大模型工程化与知识增强

蒸馏、量化、微调和RAG到底有什么区别?

直接答案:蒸馏解决能力迁移,量化解决部署资源,微调解决任务行为,RAG解决外部知识。四种技术可以组合,但不能互相替代。

综合对比入口4个概念20个关联问题证据状态:已核验

先用一句话分清

四种技术解决四类不同问题

蒸馏解决能力迁移,量化解决部署资源,微调解决任务行为,RAG解决外部知识。四种技术可以组合,但不能互相替代。

概念主要解决什么改变什么最容易误解
知识蒸馏把教师能力迁移给更小模型训练新的学生模型不是完整复制教师全部能力
模型量化减少显存和计算资源降低权重或激活等数值精度省显存不等于任何硬件都更快
模型微调让模型适配任务、格式和行为更新全部参数或适配参数不等于建立可更新的企业知识库
RAG让回答调用外部资料推理时检索并加入上下文接入知识库不等于彻底消除幻觉

根据真实问题选择

先判断你遇到的是能力、资源、行为还是知识问题

大模型调用成本太高

知识蒸馏

把明确任务迁移给更小模型,并比较质量与成本。

显存不足或无法部署

模型量化

在目标硬件上测试位宽、速度和质量。

输出格式或任务行为不稳定

模型微调

先建立评测,再用高质量示例训练。

企业资料经常更新

RAG

让答案在运行时检索当前资料并返回来源。

可以组合,但要逐步增加

一个系统可以同时使用四种技术

  1. 1

    先定义业务任务

    明确质量、延迟、知识更新和成本目标。

  2. 2

    蒸馏明确能力

    把高成本模型的特定任务能力迁移到小模型。

  3. 3

    量化降低部署资源

    在目标设备上验证质量与速度。

  4. 4

    微调稳定行为

    让模型遵循输出格式或业务流程。

  5. 5

    RAG接入当前知识

    把外部资料、权限和来源加入回答过程。

  6. 6

    逐层建立评测

    每增加一种技术,都保留上一步基线和失败样本。

20个关联问题

继续进入具体问题

核心研究与官方资料

四种技术分别由什么证据支撑

Distilling the Knowledge in a Neural Network

Hinton、Vinyals、Dean;2015

原始研究
支持KD-C1—C5;定位:Abstract、Distillation、Experiments

提出使用教师模型软目标训练学生模型的经典知识蒸馏框架。

查看原始来源 ↗

GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Frantar等;2022

原始研究
支持MQ-C2—C4、C6;定位:Abstract、Method、Experiments

提出面向生成式预训练模型的训练后权重量化方法。

查看原始来源 ↗

LoRA: Low-Rank Adaptation of Large Language Models

Hu等;2021

原始研究
支持FT-C1、C4—C6;定位:Abstract、Method、Experiments

提出冻结预训练权重并训练低秩适配矩阵的参数高效微调方法。

查看原始来源 ↗

QLoRA: Efficient Finetuning of Quantized LLMs

Dettmers等;2023

原始研究
支持FT-C4、C6;定位:Abstract、Method、Limitations

提出在4位量化基础模型上训练LoRA适配参数的高效微调方法。

查看原始来源 ↗

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

Lewis等;NeurIPS 2020

同行评审·原始研究
支持RAG定义与机制;定位:Abstract、Methods

RAG原始定义与知识密集型任务实验。

查看原始来源 ↗
SEO.CN相关文章用于发现中文用户常见疑问与通俗表达,不作为核心技术主张的主要证据。

证据边界与内容责任

技术选择不能脱离模型、任务和环境

论文和官方文档中的效果都依赖具体模型、数据、硬件和时间。页面不提供固定产品榜单,不把特定实验数字外推为所有项目的结果,也不保证使用任一技术后获得流量、排名或商业回报。白磊负责来源核验、边界审查与版本复核。