标准定义
模型微调是什么
模型微调通过任务示例进一步调整模型参数或适配参数,使模型更稳定地完成特定任务或遵循特定输出方式;它不能替代持续更新的外部知识库和事实核验。
核心机制
模型微调通常怎样工作
- 1
定义目标行为
明确要改善的是任务正确率、格式、风格、分类还是工具调用。
- 2
准备训练与评测数据
训练数据展示理想行为,评测集用于判断真实改进。
- 3
选择调整方式
根据资源与目标选择全量微调、LoRA、QLoRA或平台提供的方法。
- 4
上线前后评测
检查目标任务、通用能力退化、偏差、安全与运行成本。
研究综合
当前研究能支持到什么程度
全量微调会更新大量或全部模型参数,资源成本较高。LoRA冻结基础模型权重,只训练低秩适配参数;QLoRA在量化基础模型上训练LoRA参数,以进一步降低显存需求。平台是否支持某种微调方式会变化,应以当前官方文档为准。微调更适合稳定行为和任务模式,频繁更新且必须回到原文核验的知识通常更适合RAG。
从真实问题开始
6个核心问题
模型微调到底改变了什么?
模型微调使用特定任务数据继续训练基础模型,改变全部参数或新增适配参数,使模型更稳定地遵循目标任务、格式、风格或工具调用方式。
微调能把企业知识永久教给模型吗?
不能这样保证。微调可能让模型学习训练数据中的模式和部分事实,但难以保证完整、精确、可更新地记住全部企业知识。频繁变化且必须核对原文的信息通常更适合RAG。
微调和RAG有什么区别?
微调主要改变模型“怎样回答和执行任务”,RAG主要在回答时提供“现在应该依据哪些外部资料”。需要稳定行为时优先考虑微调,需要最新、可引用知识时优先考虑RAG。
全量微调、LoRA和QLoRA有什么区别?
全量微调更新大量或全部基础参数;LoRA冻结基础权重并训练低秩适配参数;QLoRA在量化基础模型上训练LoRA参数,以进一步降低训练显存。
什么情况下不应该微调?
当问题可以通过更清楚的提示词、结构化输出、工具调用或RAG解决,训练数据不足或没有可靠评测时,不应急于微调。平台能力和模型生命周期不稳定时也要谨慎。
怎样判断微调是否真的有效?
在训练前建立基线,使用独立评测集比较基础模型和微调模型,并同时检查目标任务、通用能力、安全、成本和失败样本。
证据与信源
主要研究与官方资料
Supervised fine-tuning
说明监督微调通过输入与理想输出示例改善模型在特定任务中的行为,并要求先建立评测。
查看原始来源 ↗LoRA: Low-Rank Adaptation of Large Language Models
提出冻结预训练权重并训练低秩适配矩阵的参数高效微调方法。
查看原始来源 ↗QLoRA: Efficient Finetuning of Quantized LLMs
提出在4位量化基础模型上训练LoRA适配参数的高效微调方法。
查看原始来源 ↗Claude Platform Glossary: Fine-tuning
说明微调的用途与风险,并提示Claude API当前能力边界;具体可用性需以最新文档为准。
查看原始来源 ↗当前共识与边界
理解这项技术时必须保留的限制
- 微调数据中的错误、偏差和不一致可能被模型学习。
- 微调不保证模型永久、完整地记住企业资料,也不适合频繁更新的事实库。
- 模型或平台支持范围会变化,实施前必须检查当前官方能力与退役计划。
版本历史
公开修订记录
第1.0版 · 2026-07-25:首次纳入GEO百科知识库,建立6个核心问题、4个独立信源组与证据边界。
内容责任
编辑方法与利益关系
白磊负责问题设计、来源核验、边界审查和版本复核。第三方中文科普文章只用于发现用户问题与通俗表达,不作为核心技术结论的主要证据。平台能力和产品支持会变化,涉及具体产品时以当前官方文档为准。