<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>LLM-as-Judge on PlumePHP</title><link>https://plumephp.com/tags/llm-as-judge/</link><description>Recent content in LLM-as-Judge on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 27 Sep 2026 11:30:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/llm-as-judge/index.xml" rel="self" type="application/rss+xml"/><item><title>模型评估与基准：从分类指标到 LLM-as-Judge</title><link>https://plumephp.com/ai-model-evaluation/</link><pubDate>Sun, 27 Sep 2026 11:30:00 +0800</pubDate><guid>https://plumephp.com/ai-model-evaluation/</guid><description>模型评估：分类回归指标、生成式评估、评测集构建、离线与在线评估、模型卡与持续评估流程。</description></item><item><title>AI 模型测试实战：从 LLM 输出验证到 RAG 质量评估的全链路质量工程</title><link>https://plumephp.com/ai-model-testing/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/ai-model-testing/</guid><description>&lt;p&gt;传统的测试方法论建立在&lt;strong&gt;确定性&lt;/strong&gt;之上：同样的输入必然得到同样的输出，断言 &lt;code&gt;assert x == y&lt;/code&gt; 是质量的黄金标准。但以 LLM 为代表的生成式 AI 模型打破了这一前提——同样的 prompt 每次调用可能返回不同的、且没有唯一正确答案的文本。&lt;code&gt;assert response == &amp;quot;Hello&amp;quot;&lt;/code&gt; 在 AI 测试中不再有意义，取而代之的是&amp;quot;这段回答是否语义正确？&amp;ldquo;&amp;ldquo;它是否忠实于给定的知识库？&amp;ldquo;&amp;ldquo;它是否包含了偏见？&amp;quot;。本指南系统覆盖 LLM 输出验证、RAG 质量评估、Prompt 回归测试、模型性能与对抗性测试，以及 MLOps CI/CD 中的模型质量门禁建设。&lt;/p&gt;</description></item><item><title>模型评估与 LLMOps：从离线评测到生产监控的闭环体系</title><link>https://plumephp.com/llm-evaluation-llmops/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-evaluation-llmops/</guid><description>&lt;p&gt;LLM 应用上线后的最大风险不是&amp;quot;跑不起来&amp;quot;，而是&amp;quot;悄悄变差&amp;quot;——模型升级、Prompt 改动、知识库更新都可能引入质量回归，而概率性输出让这种退化难以用传统测试发现。LLMOps 的核心是建立&lt;strong&gt;评估（Evaluation）与监控（Monitoring）的闭环&lt;/strong&gt;：离线用评测集守住质量基线，在线用指标捕获漂移。本指南系统覆盖评测集设计、指标选型、LLM-as-a-Judge 可靠性、回归门禁、生产监控与成本治理的完整实践。&lt;/p&gt;</description></item><item><title>生成式 AI 可观测性：LLM 调用追踪、Token 成本监控、质量与安全评估</title><link>https://plumephp.com/genai-observability/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/genai-observability/</guid><description>&lt;p&gt;传统应用的可观测性（Metrics/Logs/Traces）在 LLM 应用面前依然成立，但要新增三个 LLM 特有的观测维度：&lt;strong&gt;Token 与成本&lt;/strong&gt;（每次调用消耗多少、花了多少钱）、&lt;strong&gt;模型质量&lt;/strong&gt;（回答对不对、是否幻觉、是否符合预期）、&lt;strong&gt;模型安全&lt;/strong&gt;（提示注入、有害内容、PII 泄露）。大模型是&amp;quot;黑盒&amp;quot;，它的行为是概率性的——同一提示词每次输出都不同，这决定了 GenAI 可观测性不能只看&amp;quot;延迟和错误码&amp;quot;，还要看&lt;strong&gt;语义层面的质量与安全&lt;/strong&gt;。本指南系统构建 GenAI 应用可观测体系：LLM 调用追踪、OTel GenAI 语义约定、成本用量监控、质量评估（LLM-as-Judge）、RAG 评估、安全监控、漂移检测与反馈回路，最后给出完整架构。&lt;/p&gt;</description></item></channel></rss>