tag

LLM-as-Judge

共 4 篇文章。
全部文章GoGolangGodotTutorialRustSaaSRust TutorsLuaPrd游戏客户端Long Term Novel Writing ExperienceSpore Trilogy Creative Writing Notes孢子三部曲孢子三部曲创作手记回顾
ai

模型评估与基准:从分类指标到 LLM-as-Judge

模型评估是机器学习工程中最容易被低估的环节,指标选错会让整个迭代方向出错。本文系统讲解评估体系:分类指标(准确率/精确率/召回/F1/AUC-ROC)、回归与概率校准(Brier/ECE)、生成式评估(BLEU/ROUGE/人工/LLM-as-Judge)、评测集构建(Golden set/对抗样本)、离线与在线评估(A/B 测试/影子部署)、模型卡与基准报告,以及持续评估流程中的常见陷阱。

10 分钟阅读
模型评估 指标 AUC
Observability

生成式 AI 可观测性:LLM 调用追踪、Token 成本监控、质量与安全评估

传统应用的可观测性(Metrics/Logs/Traces)在 LLM 应用面前依然成立,但要新增三个 LLM 特有的观测维度:Token 与成本(每次调用消耗多少、花了多少钱)、模型质量(回答对不对、是否幻觉、是否符合预期)、模型安全(提示注入、有害内容、PII 泄露)。大模型是"黑盒 …

8 分钟阅读
genai llm observability