<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Embedding on PlumePHP</title><link>https://plumephp.com/tags/embedding/</link><description>Recent content in Embedding on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 27 Sep 2026 12:30:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/embedding/index.xml" rel="self" type="application/rss+xml"/><item><title>向量数据库选型与检索优化：从 ANN 索引到生产运维</title><link>https://plumephp.com/ai-vector-database/</link><pubDate>Sun, 27 Sep 2026 11:00:00 +0800</pubDate><guid>https://plumephp.com/ai-vector-database/</guid><description>向量数据库：ANN 索引原理、主流方案对比、参数调优、混合过滤、容量规划与生产运维。</description></item><item><title>Redis 向量检索实战：RediSearch、HNSW 与 Embedding 管道集成</title><link>https://plumephp.com/redis-vector-search/</link><pubDate>Sun, 27 Sep 2026 12:30:00 +0800</pubDate><guid>https://plumephp.com/redis-vector-search/</guid><description>&lt;p&gt;大模型时代，&amp;ldquo;语义检索&amp;quot;成为刚需：把文本、图片、商品编码成向量（Embedding），用向量相似度替代关键词匹配。传统 Redis 只存&amp;quot;精确值&amp;rdquo;，而 &lt;strong&gt;Redis Stack 的 RediSearch 模块（2.4+）&lt;/strong&gt; 让 Redis 原生支持向量索引与相似度搜索——这意味着语义搜索、RAG 检索、实时去重可以在同一套 Redis 基础设施上完成，无需引入独立的向量数据库。&lt;/p&gt;</description></item><item><title>Agent 记忆系统实战：从上下文窗口到长期记忆的持久化架构</title><link>https://plumephp.com/llm-agent-memory-persistence/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-agent-memory-persistence/</guid><description>&lt;p&gt;LLM 本身没有记忆——每次调用都从空白上下文开始。但真实的智能应用需要跨会话记住用户偏好、任务进度与历史事实。Agent 记忆系统正是为了解决&amp;quot;上下文是易失的、知识是永恒的&amp;quot;这一矛盾而生的工程领域。本指南从记忆的类型学出发，系统覆盖短期工作记忆、长期语义记忆、情景记忆与程序性记忆的落地实现，并给出向量库、SQLite、文件系统三种存储方案的完整代码。&lt;/p&gt;</description></item><item><title>Embedding 与 Reranker 深度调优：检索质量的决定性引擎</title><link>https://plumephp.com/llm-embedding-reranker/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-embedding-reranker/</guid><description>&lt;p&gt;RAG 系统的质量上限由检索器决定：检索不到关键文档，再强的 LLM 也只能基于错误或残缺的信息作答。而检索质量的核心引擎是 &lt;strong&gt;Embedding（召回）+ Reranker（精排）&lt;/strong&gt; 的两段式架构——Embedding 用极快的向量检索从百万文档中捞出 Top-100 候选，Reranker 再用精确的交叉编码把候选精排到 Top-10。本指南从两段式架构原理出发，系统覆盖模型选型、混合检索、Query 改写、Reranker 训练微调与评测方法论。&lt;/p&gt;</description></item><item><title>LLM 语义缓存与模型路由：成本治理的两大杠杆</title><link>https://plumephp.com/llm-semantic-cache-routing/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0800</pubDate><guid>https://plumephp.com/llm-semantic-cache-routing/</guid><description>&lt;p&gt;LLM API 调用既慢又贵：单次调用延迟数百毫秒、成本随 token 线性增长，高频请求的重复计算纯粹是浪费。语义缓存与模型路由是控制 LLM 成本与延迟的两大杠杆——前者让&amp;quot;相似的问题&amp;quot;复用答案，后者让&amp;quot;简单的问题&amp;quot;用便宜模型。但二者都面临同一个陷阱：&lt;strong&gt;省钱的优化不能牺牲质量&lt;/strong&gt;。本指南从语义缓存原理出发，覆盖缓存命中策略、一致性维护、路由算法、质量门禁与生产监控，给出完整的成本治理体系。&lt;/p&gt;</description></item></channel></rss>