先用一句话分清
四种技术解决四类不同问题
蒸馏解决能力迁移,量化解决部署资源,微调解决任务行为,RAG解决外部知识。四种技术可以组合,但不能互相替代。
| 概念 | 主要解决什么 | 改变什么 | 最容易误解 |
|---|---|---|---|
| 知识蒸馏 | 把教师能力迁移给更小模型 | 训练新的学生模型 | 不是完整复制教师全部能力 |
| 模型量化 | 减少显存和计算资源 | 降低权重或激活等数值精度 | 省显存不等于任何硬件都更快 |
| 模型微调 | 让模型适配任务、格式和行为 | 更新全部参数或适配参数 | 不等于建立可更新的企业知识库 |
| RAG | 让回答调用外部资料 | 推理时检索并加入上下文 | 接入知识库不等于彻底消除幻觉 |
根据真实问题选择
先判断你遇到的是能力、资源、行为还是知识问题
大模型调用成本太高
知识蒸馏把明确任务迁移给更小模型,并比较质量与成本。
显存不足或无法部署
模型量化在目标硬件上测试位宽、速度和质量。
输出格式或任务行为不稳定
模型微调先建立评测,再用高质量示例训练。
企业资料经常更新
RAG让答案在运行时检索当前资料并返回来源。
可以组合,但要逐步增加
一个系统可以同时使用四种技术
- 1
先定义业务任务
明确质量、延迟、知识更新和成本目标。
- 2
蒸馏明确能力
把高成本模型的特定任务能力迁移到小模型。
- 3
量化降低部署资源
在目标设备上验证质量与速度。
- 4
微调稳定行为
让模型遵循输出格式或业务流程。
- 5
RAG接入当前知识
把外部资料、权限和来源加入回答过程。
- 6
逐层建立评测
每增加一种技术,都保留上一步基线和失败样本。
20个关联问题
继续进入具体问题
核心研究与官方资料
四种技术分别由什么证据支撑
Distilling the Knowledge in a Neural Network
支持KD-C1—C5;定位:Abstract、Distillation、Experiments
提出使用教师模型软目标训练学生模型的经典知识蒸馏框架。
查看原始来源 ↗GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
支持MQ-C2—C4、C6;定位:Abstract、Method、Experiments
提出面向生成式预训练模型的训练后权重量化方法。
查看原始来源 ↗LoRA: Low-Rank Adaptation of Large Language Models
支持FT-C1、C4—C6;定位:Abstract、Method、Experiments
提出冻结预训练权重并训练低秩适配矩阵的参数高效微调方法。
查看原始来源 ↗QLoRA: Efficient Finetuning of Quantized LLMs
支持FT-C4、C6;定位:Abstract、Method、Limitations
提出在4位量化基础模型上训练LoRA适配参数的高效微调方法。
查看原始来源 ↗Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
支持RAG定义与机制;定位:Abstract、Methods
RAG原始定义与知识密集型任务实验。
查看原始来源 ↗SEO.CN相关文章用于发现中文用户常见疑问与通俗表达,不作为核心技术主张的主要证据。
证据边界与内容责任
技术选择不能脱离模型、任务和环境
论文和官方文档中的效果都依赖具体模型、数据、硬件和时间。页面不提供固定产品榜单,不把特定实验数字外推为所有项目的结果,也不保证使用任一技术后获得流量、排名或商业回报。白磊负责来源核验、边界审查与版本复核。