模型压缩与知识迁移

知识蒸馏

Knowledge Distillation

知识蒸馏通过教师模型的输出、概率分布或中间表示训练学生模型,使较小模型在特定任务上接近教师模型表现,但不保证完整继承教师模型的通用能力。

Stable公开基线5个核心问题3个独立信源组第1.0版
首次发布:2026-07-25 最近更新:2026-07-25

标准定义

知识蒸馏是什么

知识蒸馏通过教师模型的输出、概率分布或中间表示训练学生模型,使较小模型在特定任务上接近教师模型表现,但不保证完整继承教师模型的通用能力。

可以把它理解为:让能力更强、运行成本更高的“教师模型”生成学习信号,再训练一个更小、更便宜的“学生模型”完成明确任务。
知识蒸馏机制图
可以把它理解为:让能力更强、运行成本更高的“教师模型”生成学习信号,再训练一个更小、更便宜的“学生模型”完成明确任务。

核心机制

知识蒸馏通常怎样工作

  1. 1

    确定任务与评测

    先明确学生模型要在什么任务、数据和成本条件下接近教师模型。

  2. 2

    生成教师信号

    教师模型为训练样本提供软目标、输出结果或其他监督信号。

  3. 3

    训练学生模型

    学生模型学习教师信号,同时可结合真实标签和任务数据。

  4. 4

    独立评测

    使用没有参与训练的测试集比较质量、成本、延迟和失败类型。

研究综合

当前研究能支持到什么程度

经典知识蒸馏研究表明,学生模型可以通过教师模型提供的软目标学习类别之间的相对关系。现代大模型工程中,蒸馏也常表现为用能力更强模型生成高质量输入—输出样本,再微调较小模型完成特定任务。两者都强调知识迁移,但具体损失函数、训练信号和适用范围并不完全相同。

从真实问题开始

5个核心问题

C1 · 已核验

知识蒸馏是什么?

知识蒸馏是一种知识迁移方法:教师模型提供软目标、输出结果或中间表示,学生模型利用这些信号学习,在明确任务上尽量接近教师模型,同时使用更少的参数或更低的运行成本。

C3 · 已核验

知识蒸馏为什么能降低成本和延迟?

蒸馏通常把明确任务迁移到更小模型。模型规模、计算量和内存需求下降后,单次推理成本和延迟有机会降低,但实际收益仍取决于硬件、上下文长度、批量和部署实现。

C4 · 已核验

知识蒸馏和普通微调有什么区别?

普通微调主要使用人工标签或理想输出让模型适配任务;知识蒸馏强调使用教师模型产生的更丰富信号训练学生模型。蒸馏经常通过微调实现,但两者的监督来源和目标并不相同。

C5 · 已核验

怎样判断蒸馏后的模型还能不能用?

需要同时比较学生模型与教师模型在目标任务上的质量、失败类型、延迟、吞吐、成本和安全表现,并使用未参与训练的数据进行重复评测。

证据与信源

主要研究与官方资料

Distilling the Knowledge in a Neural Network

Hinton、Vinyals、Dean;2015

原始研究
支持KD-C1—C5;定位:Abstract、Distillation、Experiments

提出使用教师模型软目标训练学生模型的经典知识蒸馏框架。

查看原始来源 ↗

Model Distillation in the API

OpenAI;2024

官方产品与方法说明
支持KD-C1、C3—C5;定位:Overview、How to use

说明使用能力较强模型的输出微调较小模型,并强调持续评测。

查看原始来源 ↗

DistilBERT, a distilled version of BERT

Sanh等;2019

原始研究
支持KD-C2、C3、C5;定位:Abstract、Method、Results

展示蒸馏模型在减小规模的同时保留部分语言理解能力的具体实验。

查看原始来源 ↗

当前共识与边界

理解这项技术时必须保留的限制

  • 学生模型通常只能在训练与评测覆盖的任务上接近教师模型,不能据此推断通用能力完全复制。
  • 教师输出中的错误、偏差和遗漏可能被学生模型继承。
  • 成本降低需要结合实际推理硬件、上下文长度和吞吐量测量。

版本历史

公开修订记录

第1.0版 · 2026-07-25:首次纳入GEO百科知识库,建立5个核心问题、3个独立信源组与证据边界。

内容责任

编辑方法与利益关系

白磊负责问题设计、来源核验、边界审查和版本复核。第三方中文科普文章只用于发现用户问题与通俗表达,不作为核心技术结论的主要证据。平台能力和产品支持会变化,涉及具体产品时以当前官方文档为准。