<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llmops on PlumePHP</title><link>https://plumephp.com/tags/llmops/</link><description>Recent content in Llmops on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sat, 26 Sep 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/llmops/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 语义缓存与模型路由：成本治理的两大杠杆</title><link>https://plumephp.com/llm-semantic-cache-routing/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-semantic-cache-routing/</guid><description>&lt;p&gt;LLM API 调用既慢又贵：单次调用延迟数百毫秒、成本随 token 线性增长，高频请求的重复计算纯粹是浪费。语义缓存与模型路由是控制 LLM 成本与延迟的两大杠杆——前者让&amp;quot;相似的问题&amp;quot;复用答案，后者让&amp;quot;简单的问题&amp;quot;用便宜模型。但二者都面临同一个陷阱：&lt;strong&gt;省钱的优化不能牺牲质量&lt;/strong&gt;。本指南从语义缓存原理出发，覆盖缓存命中策略、一致性维护、路由算法、质量门禁与生产监控，给出完整的成本治理体系。&lt;/p&gt;</description></item><item><title>上下文工程实战：从上下文窗口到长上下文管理的工程体系</title><link>https://plumephp.com/llm-context-engineering/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-context-engineering/</guid><description>&lt;p&gt;随着模型上下文窗口从 4K 一路扩张到 200K、甚至 1M，一个反直觉的结论浮现：&lt;strong&gt;更大的窗口不等于更好的回答&lt;/strong&gt;。研究与实践反复证明，Long Context 存在&amp;quot;迷失在中间（Lost in the Middle）&amp;ldquo;效应——模型对输入中间部分关注不足，且海量无关上下文会稀释关键信息、推高延迟与成本。上下文工程（Context Engineering）正是应对这一问题的学科：&lt;strong&gt;在有限的 token 预算内，把最有价值的信息以最优的结构注入模型&lt;/strong&gt;。本指南系统覆盖上下文结构设计、长文档策略、上下文压缩、Prompt Caching 与记忆分层，给出可落地的完整工程体系。&lt;/p&gt;</description></item><item><title>模型评估与 LLMOps：从离线评测到生产监控的闭环体系</title><link>https://plumephp.com/llm-evaluation-llmops/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-evaluation-llmops/</guid><description>&lt;p&gt;LLM 应用上线后的最大风险不是&amp;quot;跑不起来&amp;quot;，而是&amp;quot;悄悄变差&amp;quot;——模型升级、Prompt 改动、知识库更新都可能引入质量回归，而概率性输出让这种退化难以用传统测试发现。LLMOps 的核心是建立&lt;strong&gt;评估（Evaluation）与监控（Monitoring）的闭环&lt;/strong&gt;：离线用评测集守住质量基线，在线用指标捕获漂移。本指南系统覆盖评测集设计、指标选型、LLM-as-a-Judge 可靠性、回归门禁、生产监控与成本治理的完整实践。&lt;/p&gt;</description></item></channel></rss>