直接答案
怎样判断蒸馏后的模型还能不能用?
需要同时比较学生模型与教师模型在目标任务上的质量、失败类型、延迟、吞吐、成本和安全表现,并使用未参与训练的数据进行重复评测。
只看平均分可能掩盖关键业务样本上的退化。
怎样评估
判断是否有效,需要看哪些指标
任务质量
准确率、格式遵循、事实性或业务指标。
能力差距
哪些样本上学生明显弱于教师。
运行效率
延迟、吞吐、显存和调用成本。
安全与鲁棒性
边缘输入、对抗输入和拒答行为。
理解后可以这样检查
把概念落到真实项目中
- 建立未修改前的基线
- 使用未参与训练或调参的数据
- 同时检查平均指标和关键失败样本
核心主张与研究信源
本页答案由什么支撑
核心主张
需要同时比较学生模型与教师模型在目标任务上的质量、失败类型、延迟、吞吐、成本和安全表现,并使用未参与训练的数据进行重复评测。
Distilling the Knowledge in a Neural Network
支持KD-C1—C5;定位:Abstract、Distillation、Experiments
提出使用教师模型软目标训练学生模型的经典知识蒸馏框架。
查看原始来源 ↗Model Distillation in the API
支持KD-C1、C3—C5;定位:Overview、How to use
说明使用能力较强模型的输出微调较小模型,并强调持续评测。
查看原始来源 ↗DistilBERT, a distilled version of BERT
支持KD-C2、C3、C5;定位:Abstract、Method、Results
展示蒸馏模型在减小规模的同时保留部分语言理解能力的具体实验。
查看原始来源 ↗证据边界
这条结论不能被怎样误读
当前可支持
需要同时比较学生模型与教师模型在目标任务上的质量、失败类型、延迟、吞吐、成本和安全表现,并使用未参与训练的数据进行重复评测。
需要保留的边界
只看平均分可能掩盖关键业务样本上的退化。;必须保留教师模型或原系统作为对照基线。
版本记录与内容责任
谁负责、什么时候修改、如何纠错
内容负责人
白磊负责问题设计、信源关联、边界审查和版本复核。
首次公开
2026-07-25,作为“知识蒸馏”知识点的独立问题页面。
当前版本
第1.0版;后续研究与平台变化通过修订记录更新。
利益关系
GEO百科可能获得品牌或商业收益;本站自身表现不作为独立学术证据。