模型压缩与部署

模型量化

Model Quantization

模型量化通过降低权重、激活值或相关计算数据的数值精度,减少内存占用和数据传输成本;实际速度与质量取决于量化方法、位宽、模型、任务、硬件和推理实现。

Stable公开基线6个核心问题4个独立信源组第1.0版
首次发布:2026-07-25 最近更新:2026-07-25

标准定义

模型量化是什么

模型量化通过降低权重、激活值或相关计算数据的数值精度,减少内存占用和数据传输成本;实际速度与质量取决于量化方法、位宽、模型、任务、硬件和推理实现。

可以把它理解为:用更少的数值位数保存和计算模型参数,换取更低的显存与计算开销,同时接受一定的近似误差。
模型量化机制图
可以把它理解为:用更少的数值位数保存和计算模型参数,换取更低的显存与计算开销,同时接受一定的近似误差。

核心机制

模型量化通常怎样工作

  1. 1

    确定量化对象

    区分只量化权重,还是同时量化激活值、缓存或其他计算数据。

  2. 2

    选择位宽与方法

    根据模型、任务和硬件选择8位、4位或其他表示方式。

  3. 3

    执行校准或训练

    部分方法直接进行训练后量化,部分方法需要校准数据或量化感知训练。

  4. 4

    实际部署评测

    同时检查显存、吞吐、延迟、准确性、生成质量和硬件兼容性。

研究综合

当前研究能支持到什么程度

量化不是普通文件压缩,而是改变模型数值表示与计算方式。GPTQ等训练后量化方法展示了大模型低位权重量化的可行性;SmoothQuant等方法通过重新分配量化难度改善权重与激活量化;QLoRA则展示了量化基础模型与参数高效微调的组合。任何论文结果都依赖具体模型、任务和硬件,不能直接外推到所有部署。

从真实问题开始

6个核心问题

C1 · 已核验

模型量化到底改变了什么?

模型量化改变的是模型权重、激活值或其他计算数据的数值表示精度,例如从16位或32位浮点表示降到8位或4位表示,以减少内存和计算开销。

C2 · 已核验

4位、8位量化是什么意思?

4位或8位通常表示模型的部分权重或计算数据使用约4个或8个二进制位表示。位宽越低,理论存储占用越小,但误差控制、硬件支持和运行质量通常更难。

C3 · 已核验

模型量化后一定会变快吗?

不一定。量化通常能降低显存和数据传输需求,但是否加速还取决于硬件是否支持低精度计算、推理内核是否优化、批量大小和解量化开销。

C4 · 已核验

量化会让模型能力下降多少?

没有统一答案。能力变化取决于位宽、量化对象、算法、校准数据、模型结构和任务。合理方法可能在部分评测中保持大部分能力,但低位量化也可能显著损害特定推理和生成任务。

C5 · 已核验

量化和知识蒸馏有什么区别?

量化主要降低模型数值表示精度,通常不需要重新设计模型能力;知识蒸馏则用教师模型训练学生模型,重点是把能力迁移到更小模型。两者都可降低成本,但作用对象不同。

C6 · 已核验

怎样选择适合自己的量化方式?

先明确目标硬件、可接受质量损失、上下文长度和吞吐要求,再用代表性数据比较不同位宽与方法。不要只根据“4位更省”或单一排行榜做决定。

证据与信源

主要研究与官方资料

Quantization overview

Hugging Face Transformers

官方技术文档
支持MQ-C1—C3、C6;定位:Overview

说明量化通过更低精度表示权重等数据以降低模型加载和使用的内存需求。

查看原始来源 ↗

GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Frantar等;2022

原始研究
支持MQ-C2—C4、C6;定位:Abstract、Method、Experiments

提出面向生成式预训练模型的训练后权重量化方法。

查看原始来源 ↗

SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

Xiao等;2022

原始研究
支持MQ-C1—C4、C6;定位:Abstract、Method

通过平滑权重与激活的量化难度支持大模型W8A8量化。

查看原始来源 ↗

QLoRA: Efficient Finetuning of Quantized LLMs

Dettmers等;2023

原始研究
支持MQ-C4—C6;定位:Abstract、Method、Limitations

展示4位量化基础模型与LoRA适配参数训练的组合方法。

查看原始来源 ↗

当前共识与边界

理解这项技术时必须保留的限制

  • 低位宽可能放大误差,尤其会影响部分推理、生成和长上下文任务。
  • 量化模型是否更快取决于硬件和推理内核,显存下降不等于延迟一定下降。
  • 不同量化格式和运行环境可能不兼容,需要在目标设备上验证。

版本历史

公开修订记录

第1.0版 · 2026-07-25:首次纳入GEO百科知识库,建立6个核心问题、4个独立信源组与证据边界。

内容责任

编辑方法与利益关系

白磊负责问题设计、来源核验、边界审查和版本复核。第三方中文科普文章只用于发现用户问题与通俗表达,不作为核心技术结论的主要证据。平台能力和产品支持会变化,涉及具体产品时以当前官方文档为准。