<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>生产部署 on PlumePHP</title><link>https://plumephp.com/tags/%E7%94%9F%E4%BA%A7%E9%83%A8%E7%BD%B2/</link><description>Recent content in 生产部署 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/%E7%94%9F%E4%BA%A7%E9%83%A8%E7%BD%B2/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 推理服务架构设计：从单机到分布式集群</title><link>https://plumephp.com/ai-llm-inference-architecture/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-llm-inference-architecture/</guid><description>&lt;p&gt;随着大型语言模型（LLM）从实验室走向生产环境，构建一个高吞吐、低延迟、可弹性伸缩的推理服务架构，已成为 AI 工程团队的核心命题。与传统的请求-响应式服务不同，LLM 推理具有内存占用高、计算密集、延迟不可预测等特点，这要求我们在架构设计时必须引入一套全新的技术范式。本文将从单机部署出发，逐步推演到分布式集群方案，系统梳理 LLM 推理服务的关键设计考量。&lt;/p&gt;</description></item><item><title>NVIDIA Triton Inference Server 生产部署</title><link>https://plumephp.com/ai-triton-server/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-triton-server/</guid><description>&lt;p&gt;在 AI 模型落地的最后一公里，推理服务的稳定性、吞吐量和延迟直接决定了用户体验。NVIDIA Triton Inference Server（以下简称 Triton）作为企业级推理框架的代表，已经成为大型生产系统的标配组件。本文将从架构原理、配置调优到生产部署实践，系统梳理 Triton 的完整使用路径。&lt;/p&gt;</description></item><item><title>TensorRT-LLM：大语言模型的高效推理部署</title><link>https://plumephp.com/ai-tensorrt-llm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt-llm/</guid><description>&lt;p&gt;大语言模型（LLM）的推理部署是 AI 基础设施的核心挑战之一。随着模型参数量从数十亿增长到数千亿，如何在保证低延迟和高吞吐的前提下高效运行这些模型，成为生产环境的必答题。NVIDIA 推出的 &lt;strong&gt;TensorRT-LLM&lt;/strong&gt; 正是为了解决这一痛点而诞生的专用推理框架。本文将系统性地介绍 TensorRT-LLM 的核心机制、优化手段和落地实践。&lt;/p&gt;</description></item></channel></rss>