Supervised Fine-Tuning
对已经完成训练的模型,再展示一批带有标准答案的问答示例,让它按照期望的方式重新学习如何回答的后续训练阶段。
简单来说
监督微调是指对一个已经完成训练的模型,展示一批问题和标准答案配对的示例,让它按照期望的方式重新学习如何作答的训练阶段。
可以用刚入职的新员工来理解。新员工已经具备广泛的知识和语言能力,但公司想要的报告格式或客户应答方式,还需要单独教。就像公司把写有标准答案的工作手册交给员工照着做一样,监督微调会反复向模型展示带有正确答案的练习题,让它养成按特定语气、格式或特定领域知识作答的习惯。
最近这项工作的门槛大幅降低。曾经要重新训练大型模型需要昂贵的服务器级设备,但现在只挑选模型的一部分进行低成本再训练的节省型方法逐渐普及,使得一张游戏显卡就能训练出270亿参数规模的模型。因此,个人或小团队亲自打造针对特定语言或领域的定制模型的案例正在增加。
在报道中是这样出现的
文章中常以SFT或“监督学习(SFT)”这样的缩写形式出现。Qwen3.8-27B的训练指南中说明,“如果只用文本数据做监督学习(SFT),只需准备一个用Qwen对话模板渲染出text列的数据集即可”;而在法语专用模型Luth-2的报道中提到,团队新构建了一套涵盖数学、知识、代码、工具调用、多轮对话等内容、规模达30亿token的监督学习(SFT)数据集。常见的一个误解是,监督微调并不是从零开始构建模型的过程,而是对已经具备基础能力的模型进行打磨的后续阶段。
亲手试一试
- 找一个问答配对的公开数据集。
- 打开一个可免费使用的训练用notebook环境,选择想要重新训练的开源模型。
- 将数据集整理成模型所要求的对话格式。
- 执行监督微调,让模型学习按照新示例作答。
- 保存训练完成的模型,亲自提问,看看它的回答方式发生了怎样的变化。
相关词条
出现过这个词的报道
- 谷歌研究院发布多变量时间序列预测模型TimesFM-3AI · 2026.09.01
- Artificial Analysis,智能指数升级至v4.1.1,更换评分模型AI · 2026.08.09
- Upstage Solar Pro 4,智能指数从14分升至42分AI · 2026.08.13
- DeepSeek v4 Flash推出DwarfStar专用GGUF版本 降低本地部署门槛AI · 2026.08.01
- Liquid AI, 3亿参数级草稿模型让解码最高提速3.18倍AI · 2026.08.21
- Midjourney,Alpha网站改版两周后修复文件夹、放大功能创意 · 2026.08.22
