<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI 推理加速与系统专题：从 CUDA 到生产级推理引擎 on PlumePHP</title><link>https://plumephp.com/posts/ai/</link><description>Recent content in AI 推理加速与系统专题：从 CUDA 到生产级推理引擎 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 27 Sep 2026 11:30:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/posts/ai/index.xml" rel="self" type="application/rss+xml"/><item><title>量化感知训练（QAT）与量化微调：伪量化、STE 与 QLoRA 实战</title><link>https://plumephp.com/ai-qat-quantization-aware/</link><pubDate>Sun, 27 Sep 2026 11:30:00 +0800</pubDate><guid>https://plumephp.com/ai-qat-quantization-aware/</guid><description>&lt;blockquote&gt;
&lt;p&gt;训练后量化（PTQ）在精度敏感场景常常失手，量化感知训练（QAT）则让模型在训练阶段就&amp;quot;学会&amp;quot;适应量化噪声，是工业界把 INT8 精度损失压到 1% 以内的关键手段。本文从伪量化算子与直通估计器（STE）讲起，给出 QAT 完整流程，讲解蒸馏+量化组合，并深入 LoRA 量化微调（QLoRA）与工业实践。&lt;/p&gt;</description></item><item><title>边缘端推理部署：TFLite、ONNX Mobile 与 NPU 异构加速实践</title><link>https://plumephp.com/ai-edge-inference-deployment/</link><pubDate>Sun, 27 Sep 2026 11:00:00 +0800</pubDate><guid>https://plumephp.com/ai-edge-inference-deployment/</guid><description>&lt;blockquote&gt;
&lt;p&gt;当推理发生在手机、摄像头、车载设备上，约束从&amp;quot;算得快&amp;quot;变成&amp;quot;在有限功耗和内存内算得好&amp;quot;。本文聚焦边缘端推理：对比 TFLite / ONNX Runtime Mobile / ExecuTorch / OpenVINO 等移动框架，讲解 Qualcomm 与 Apple NPU 的异构调度，给出端侧量化与模型压缩的组合拳，并拆解目标检测、端侧 LLM、语音助手三类典型应用。&lt;/p&gt;</description></item><item><title>推理基准与压测：TTFT、ITL、TPOT 指标与容量规划实战</title><link>https://plumephp.com/ai-inference-benchmark/</link><pubDate>Sun, 27 Sep 2026 10:30:00 +0800</pubDate><guid>https://plumephp.com/ai-inference-benchmark/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&amp;ldquo;我的推理服务到底能扛多大流量？&amp;ldquo;&amp;ldquo;加一张卡值不值？&amp;ldquo;&amp;ldquo;P99 为什么这么差？&amp;ldquo;这些问题都需要一套科学的基准测试方法。本文讲解 LLM 推理的核心性能指标 TTFT / ITL / TPOT，分析延迟与吞吐曲线，演示 LLM Perf 与 Locust 两类压测工具，最后给出容量规划与成本建模的完整方法。&lt;/p&gt;</description></item><item><title>算子融合与 Kernel 优化：从 CUDA Graph 到 FlashAttention 的极致性能</title><link>https://plumephp.com/ai-kernel-fusion-optimization/</link><pubDate>Sun, 27 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-kernel-fusion-optimization/</guid><description>&lt;blockquote&gt;
&lt;p&gt;在 GPU 推理中，最贵的往往不是计算，而是数据搬运：每一个算子都要把中间结果写回显存、再读出来，内存带宽成为瓶颈。算子融合就是把多个算子合并成一个 kernel，减少显存往返，是 TensorRT、vLLM、PyTorch 编译器都在做的事。本文从融合原理讲起，拆解 FlashAttention 类融合，再到 CUDA Graph 与自定义 kernel 开发流程。&lt;/p&gt;</description></item><item><title>分布式推理与 GPU 集群调度：张量并行、流水并行与调度器实战</title><link>https://plumephp.com/ai-distributed-inference-gpu-cluster/</link><pubDate>Sun, 27 Sep 2026 09:30:00 +0800</pubDate><guid>https://plumephp.com/ai-distributed-inference-gpu-cluster/</guid><description>&lt;blockquote&gt;
&lt;p&gt;当单卡放不下一个 70B 模型，或单卡无法满足线上吞吐时，分布式推理就从&amp;quot;可选优化&amp;quot;变成&amp;quot;必选项&amp;quot;。本文系统讲解张量并行、流水线并行与专家并行三大策略的通信代价与适用场景，介绍连续批处理在集群中的落地，并深入 KServe 与 Ray Serve 两类 GPU 调度器的架构与配置。&lt;/p&gt;</description></item><item><title>多模态推理实战：从图像 Token 化到视觉语言模型联合推理</title><link>https://plumephp.com/ai-multimodal-inference/</link><pubDate>Sun, 27 Sep 2026 09:00:00 +0800</pubDate><guid>https://plumephp.com/ai-multimodal-inference/</guid><description>&lt;blockquote&gt;
&lt;p&gt;大语言模型的文本能力已经被充分挖掘，而让模型&amp;quot;看懂图&amp;quot;的多模态推理，正在成为企业级应用的新战场：文档解析、商品识别、自动驾驶、智能客服。本文从图像如何变成 Token 讲起，深入视觉语言模型（VLM）的联合推理机制、多模态 KV Cache 显存管理，再到生产级多模态推理服务部署。&lt;/p&gt;</description></item><item><title>cuBLAS / cuDNN / cuFFT：NVIDIA 加速库实战</title><link>https://plumephp.com/ai-cuda-libraries/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-libraries/</guid><description>&lt;p&gt;在 &lt;a href="https://plumephp.com/posts/hpc/"&gt;CUDA&lt;/a&gt; &lt;a href="https://plumephp.com/posts/cpp/"&gt;C++&lt;/a&gt; 应用开发中，开发者很少从零编写核函数。NVIDIA 官方提供了一套经过深度优化的加速库，覆盖线性代数、&lt;a href="https://plumephp.com/posts/ml/"&gt;深度学习&lt;/a&gt;、信号处理、并行算法等核心场景。这套库不仅性能卓越，而且经过大量生产环境验证。本文将系统梳理 cuBLAS、cuDNN、cuFFT、Thrust 以及 Cutlass 的用法与工程实践。&lt;/p&gt;</description></item><item><title>CUDA 内存管理与性能优化：Bank Conflict 与合并访问</title><link>https://plumephp.com/ai-cuda-memory-optimization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-memory-optimization/</guid><description>&lt;p&gt;在现代 GPU 计算中，内存访问模式往往是决定内核性能的首要因素。算法复杂度相同的两个 &lt;a href="https://plumephp.com/posts/hpc/"&gt;CUDA&lt;/a&gt; Kernel，仅仅因为访问显存的方式不同，执行时间可能相差数倍甚至一个数量级。本文将系统梳理 CUDA 编程中各类内存的访问特性，深入讲解合并访问（Coalesced Access）与 Bank Conflict 的核心原理，并给出配套的代码示例与优化实践。&lt;/p&gt;</description></item><item><title>CUDA 编程入门：从 Hello GPU 到线程网格模型</title><link>https://plumephp.com/ai-cuda-basics/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-cuda-basics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;在大模型推理与训练日益普及的今天，GPU 已不再是游戏玩家的专属硬件，而是 AI 基础设施的核心。理解 &lt;a href="https://plumephp.com/posts/hpc/"&gt;CUDA&lt;/a&gt; 编程，是每一位希望深入 AI 系统优化的工程师必经之路。本文从零开始，带你掌握 GPU 并行计算的核心概念与实战代码。&lt;/p&gt;</description></item><item><title>GPTQ / AWQ / W4A16：大语言模型权重量化实战</title><link>https://plumephp.com/ai-llm-quantization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-llm-quantization/</guid><description>&lt;p&gt;使用 70 GB 显存才能跑一次的 Llama-2-70B，量化后可以塞进 24 GB 的消费级显卡。这不是魔法，而是大语言模型（&lt;a href="https://plumephp.com/posts/llm/"&gt;LLM&lt;/a&gt;）权重量化带来的实际收益。本文将深入讲解 GPTQ、AWQ、SmoothQuant、W4A16 等主流量化方案的原理与实战，帮助你在生产环境中实现 4 倍模型压缩而不显著牺牲精度。&lt;/p&gt;</description></item><item><title>KV Cache 优化与注意力机制加速：FlashAttention / PagedAttention</title><link>https://plumephp.com/ai-attention-optimization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-attention-optimization/</guid><description>&lt;p&gt;大型语言模型（&lt;a href="https://plumephp.com/posts/llm/"&gt;LLM&lt;/a&gt;）的推理性能已经成为生产环境部署中的核心挑战。在 Transformer 架构中，自注意力机制（Self-Attention）虽然在建模长距离依赖方面表现出色，但其计算和内存开销随序列长度呈平方增长。当上下文窗口扩展到 128K 甚至 1M token 时，传统的注意力实现会迅速触及 GPU 硬件瓶颈。本文将深入探讨三项关键技术——FlashAttention、PagedAttention 与 KV Cache 优化——它们分别从计算效率和内存管理两个维度重塑了 LLM 推理的工程实践。&lt;/p&gt;</description></item><item><title>LLM 推理服务架构设计：从单机到分布式集群</title><link>https://plumephp.com/ai-llm-inference-architecture/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-llm-inference-architecture/</guid><description>&lt;p&gt;随着大型语言模型（&lt;a href="https://plumephp.com/posts/llm/"&gt;LLM&lt;/a&gt;）从实验室走向生产环境，构建一个高吞吐、低延迟、可弹性伸缩的推理服务架构，已成为 AI 工程团队的核心命题。与传统的请求-响应式服务不同，LLM 推理具有内存占用高、计算密集、延迟不可预测等特点，这要求我们在架构设计时必须引入一套全新的技术范式。本文将从单机部署出发，逐步推演到分布式集群方案，系统梳理 LLM 推理服务的关键设计考量。&lt;/p&gt;</description></item><item><title>NVIDIA Triton Inference Server 生产部署</title><link>https://plumephp.com/ai-triton-server/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-triton-server/</guid><description>&lt;p&gt;在 AI 模型落地的最后一公里，推理服务的稳定性、吞吐量和延迟直接决定了用户体验。NVIDIA Triton Inference Server（以下简称 Triton）作为企业级推理框架的代表，已经成为大型生产系统的标配组件。本文将从架构原理、配置调优到生产部署实践，系统梳理 Triton 的完整使用路径。&lt;/p&gt;</description></item><item><title>ONNX Runtime 跨平台推理优化</title><link>https://plumephp.com/ai-onnx-runtime/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-onnx-runtime/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;随着深度学习模型越来越多地部署到边缘设备与多样化硬件之上，模型格式与推理引擎的统一化已成为工程落地的关键瓶颈。&lt;a href="https://plumephp.com/posts/ml/"&gt;PyTorch&lt;/a&gt; 和 &lt;a href="https://plumephp.com/posts/ml/"&gt;TensorFlow&lt;/a&gt; 各自拥有庞大的生态系统，但训练后时将模型转换为一个与框架无关的中间表示，才能真正实现&amp;quot;一次导出、到处运行&amp;quot;。ONNX（Open Neural Network Exchange）正是为此而生，而 ONNX Runtime 作为其官方高性能推理引擎，已经成为跨平台模型部署的事实标准之一。&lt;/p&gt;</description></item><item><title>TensorRT 深度实践：从 ONNX 到高性能推理引擎</title><link>https://plumephp.com/ai-tensorrt/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt/</guid><description>&lt;h2 id="1-tensorrt-简介"&gt;1. TensorRT 简介&lt;/h2&gt;
&lt;p&gt;TensorRT 是 NVIDIA 推出的高性能深度学习推理 SDK，核心目标是将训练好的模型转化为能够在 NVIDIA GPU 上高效执行的推理引擎。与基于 &lt;a href="https://plumephp.com/posts/ml/"&gt;PyTorch&lt;/a&gt;、&lt;a href="https://plumephp.com/posts/ml/"&gt;TensorFlow&lt;/a&gt; 的原生推理相比，TensorRT 通过层融合（Layer Fusion）、精度校准（Precision Calibration）和张量内存优化等手段，通常能带来 &lt;strong&gt;2~10 倍&lt;/strong&gt; 的推理加速，同时显著降低延迟和显存占用。&lt;/p&gt;</description></item><item><title>TensorRT-LLM：大语言模型的高效推理部署</title><link>https://plumephp.com/ai-tensorrt-llm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-tensorrt-llm/</guid><description>&lt;p&gt;&lt;a href="https://plumephp.com/posts/llm/"&gt;大语言模型&lt;/a&gt;（LLM）的推理部署是 AI 基础设施的核心挑战之一。随着模型参数量从数十亿增长到数千亿，如何在保证低延迟和高吞吐的前提下高效运行这些模型，成为生产环境的必答题。NVIDIA 推出的 &lt;strong&gt;TensorRT-LLM&lt;/strong&gt; 正是为了解决这一痛点而诞生的专用推理框架。本文将系统性地介绍 TensorRT-LLM 的核心机制、优化手段和落地实践。&lt;/p&gt;</description></item><item><title>vLLM 深度解析：连续批处理与内存高效推理</title><link>https://plumephp.com/ai-vllm-system/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-vllm-system/</guid><description>&lt;p&gt;&lt;a href="https://plumephp.com/posts/llm/"&gt;大语言模型&lt;/a&gt;（LLM）推理服务的扩展性瓶颈，往往不在计算吞吐量，而在 GPU 显存。传统推理框架将 KV Cache 以连续张量形式预分配，造成大量内存浪费，导致 batch size 被严重限制。vLLM 通过引入操作系统虚拟内存机制启发的 PagedAttention，将显存利用效率推向新高度，成为当前开源 LLM 推理引擎的事实标准之一。&lt;/p&gt;</description></item><item><title>推理引擎终极对比：TensorRT vs ONNX Runtime vs OpenVINO</title><link>https://plumephp.com/ai-inference-engine-comparison/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-inference-engine-comparison/</guid><description>&lt;p&gt;模型训练完成后，真正的挑战才刚刚开始：如何让模型在生产环境中跑得又快又稳？选择一个合适的推理引擎，往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO，从延迟、吞吐、硬件兼容性到量化策略逐一拆解，并给出可直接落地的选型决策树与混合部署方案。&lt;/p&gt;</description></item><item><title>模型剪枝与知识蒸馏：从压缩到加速全链路</title><link>https://plumephp.com/ai-model-compression/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-model-compression/</guid><description>&lt;h2 id="引言为什么需要模型压缩"&gt;引言：为什么需要模型压缩&lt;/h2&gt;
&lt;p&gt;深度学习模型的参数量正在以指数级增长。从 AlexNet 的 6000 万参数，到 GPT-4 的万亿级参数，模型能力的提升往往伴随着体积的膨胀。然而，在生产环境中部署这些庞大模型时，我们面临着严峻的现实约束：&lt;/p&gt;</description></item><item><title>模型量化技术详解：INT8、FP16 与混合精度推理</title><link>https://plumephp.com/ai-quantization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-quantization/</guid><description>&lt;p&gt;在深度学习落地过程中，模型体积与推理延迟往往是最大的拦路虎。一个经过充分训练的 ResNet-50 FP32 模型约有 98 MB，而大型语言模型的参数规模更是以 GB 甚至 TB 计。模型量化（Model Quantization）通过降低数值精度，在几乎不损失精度的前提下，将模型压缩数倍并显著加速推理。本文将系统梳理从 FP16 到 INT8 的量化原理、PTQ 与 QAT 两大技术路线，并结合 TensorRT 与 ONNX Runtime 给出可落地的工程实践。&lt;/p&gt;</description></item></channel></rss>