<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>INT8 on PlumePHP</title><link>https://plumephp.com/tags/int8/</link><description>Recent content in INT8 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 10 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/tags/int8/index.xml" rel="self" type="application/rss+xml"/><item><title>模型量化技术详解：INT8、FP16 与混合精度推理</title><link>https://plumephp.com/ai-quantization/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/ai-quantization/</guid><description>&lt;p&gt;在深度学习落地过程中，模型体积与推理延迟往往是最大的拦路虎。一个经过充分训练的 ResNet-50 FP32 模型约有 98 MB，而大型语言模型的参数规模更是以 GB 甚至 TB 计。模型量化（Model Quantization）通过降低数值精度，在几乎不损失精度的前提下，将模型压缩数倍并显著加速推理。本文将系统梳理从 FP16 到 INT8 的量化原理、PTQ 与 QAT 两大技术路线，并结合 TensorRT 与 ONNX Runtime 给出可落地的工程实践。&lt;/p&gt;</description></item></channel></rss>