posts

AI 推理加速与系统专题:从 CUDA 到生产级推理引擎

AI 推理系统完整专题:CUDA GPU 并行编程、cuBLAS/cuDNN 加速库、算子融合与 CUDA Graph、TensorRT 推理优化、ONNX Runtime 跨平台部署、vLLM 高吞吐服务、模型量化与压缩(INT8/FP16/GPTQ/QAT)、分布式推理与 GPU 集群调度、推理基准与压测、多模态推理与边缘端推理部署,覆盖从 GPU 编程到推理工程化全栈实践。
全部文章 Game Golang SaaS Rust 游戏开发 客户端开发 GameDev Lua 写作 小说
ai

量化感知训练(QAT)与量化微调:伪量化、STE 与 QLoRA 实战

训练后量化(PTQ)在精度敏感场景常常失手,量化感知训练(QAT)则让模型在训练阶段就『学会』适应量化噪声,是工业界把 INT8 精度损失压到 1% 以内的关键手段。本文从伪量化算子与直通估计器(STE)讲起,给出 QAT 完整流程,讲解蒸馏+量化组合,并深入 LoRA 量化微调(QLoRA)与工业实践。一、QAT 背景与动机

8 分钟阅读
QAT 量化 模型压缩
ai

边缘端推理部署:TFLite、ONNX Mobile 与 NPU 异构加速实践

当推理发生在手机、摄像头、车载设备上,约束从『算得快』变成『在有限功耗和内存内算得好』。本文聚焦边缘端推理:对比 TFLite / ONNX Runtime Mobile / ExecuTorch / OpenVINO 等移动框架,讲解 Qualcomm 与 Apple NPU 的异构调度,给出端侧量化与模型压缩的组合拳,并拆解目标检测、端侧 LLM、语音助手三类典型应用。一、边缘推理的约束

9 分钟阅读
边缘推理 移动端 NPU
ai

推理基准与压测:TTFT、ITL、TPOT 指标与容量规划实战

『我的推理服务到底能扛多大流量?』『加一张卡值不值?』『P99 为什么这么差?』这些问题都需要一套科学的基准测试方法。本文讲解 LLM 推理的核心性能指标 TTFT / ITL / TPOT,分析延迟与吞吐曲线,演示 LLM Perf 与 Locust 两类压测工具,最后给出容量规划与成本建模的完整方法。一、推理性能指标体系

8 分钟阅读
基准测试 压测 LLM
ai

算子融合与 Kernel 优化:从 CUDA Graph 到 FlashAttention 的极致性能

在 GPU 推理中,最贵的往往不是计算,而是数据搬运:每一个算子都要把中间结果写回显存、再读出来,内存带宽成为瓶颈。算子融合就是把多个算子合并成一个 kernel,减少显存往返,是 TensorRT、vLLM、PyTorch 编译器都在做的事。本文从融合原理讲起,拆解 FlashAttention 类融合,再到 CUDA Graph 与自定义 kernel 开发流程。一、为什么需要算子融合

8 分钟阅读
Kernel 优化 CUDA 算子融合
ai

分布式推理与 GPU 集群调度:张量并行、流水并行与调度器实战

当单卡放不下一个 70B 模型,或单卡无法满足线上吞吐时,分布式推理就从『可选优化』变成『必选项』。本文系统讲解张量并行、流水线并行与专家并行三大策略的通信代价与适用场景,介绍连续批处理在集群中的落地,并深入 KServe 与 Ray Serve 两类 GPU 调度器的架构与配置。一、为什么需要分布式推理

10 分钟阅读
分布式推理 GPU 并行计算
ai

多模态推理实战:从图像 Token 化到视觉语言模型联合推理

大语言模型的文本能力已经被充分挖掘,而让模型『看懂图』的多模态推理,正在成为企业级应用的新战场:文档解析、商品识别、自动驾驶、智能客服。本文从图像如何变成 Token 讲起,深入视觉语言模型(VLM)的联合推理机制、多模态 KV Cache 显存管理,再到生产级多模态推理服务部署。一、从单模态到多模态:VLM 推理的挑战

9 分钟阅读
多模态 VLM 推理加速
ai

推理引擎终极对比:TensorRT vs ONNX Runtime vs OpenVINO

模型训练完成后,真正的挑战才刚刚开始:如何让模型在生产环境中跑得又快又稳?选择一个合适的推理引擎,往往比换一块更贵的显卡带来的收益更大。本文将深入对比业界三大主流推理引擎 —— TensorRT、ONNX Runtime 和 OpenVINO,从延迟、吞吐、硬件兼容性到量化策略逐一拆解,并给出可直接

11 分钟阅读
推理引擎 对比 选型