<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Multi-Model on PlumePHP</title><link>https://plumephp.com/tags/multi-model/</link><description>Recent content in Multi-Model on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sat, 26 Sep 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/multi-model/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 语义缓存与模型路由：成本治理的两大杠杆</title><link>https://plumephp.com/llm-semantic-cache-routing/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-semantic-cache-routing/</guid><description>&lt;p&gt;LLM API 调用既慢又贵：单次调用延迟数百毫秒、成本随 token 线性增长，高频请求的重复计算纯粹是浪费。语义缓存与模型路由是控制 LLM 成本与延迟的两大杠杆——前者让&amp;quot;相似的问题&amp;quot;复用答案，后者让&amp;quot;简单的问题&amp;quot;用便宜模型。但二者都面临同一个陷阱：&lt;strong&gt;省钱的优化不能牺牲质量&lt;/strong&gt;。本指南从语义缓存原理出发，覆盖缓存命中策略、一致性维护、路由算法、质量门禁与生产监控，给出完整的成本治理体系。&lt;/p&gt;</description></item></channel></rss>