模型评估与基准:从分类指标到 LLM-as-Judge
模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。
tag
模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。
传统应用的可观测性(Metrics/Logs/Traces)在 LLM 应用面前依然成立,但要新增三个 LLM 特有的观测维度:Token 与成本(每次调用消耗多少、花了多少钱)、模型质量(回答对不对、是否幻觉、是否符合预期)、模型安全(提示注入、有害内容、PII 泄露)。大模型是"黑盒 …
LLM 应用上线后的最大风险不是"跑不起来",而是"悄悄变差"——模型升级、Prompt 改动、知识库更新都可能引入质量回归,而概率性输出让这种退化难以用传统测试发现。LLMOps 的核心是建立评估(Evaluation)与监控(Monitoring)的闭环: …
传统的测试方法论建立在确定性之上:同样的输入必然得到同样的输出,断言 assert x == y 是质量的黄金标准。但以 LLM 为代表的生成式 AI 模型打破了这一前提——同样的 prompt 每次调用可能返回不同的、且没有唯一正确答案的文本。assert response == …