METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅈ报道中常见的技术词

Supervised Fine-Tuning

对已经完成训练的模型,再展示一批带有标准答案的问答示例,让它按照期望的方式重新学习如何回答的后续训练阶段。

简单来说

监督微调是指对一个已经完成训练的模型,展示一批问题和标准答案配对的示例,让它按照期望的方式重新学习如何作答的训练阶段。

可以用刚入职的新员工来理解。新员工已经具备广泛的知识和语言能力,但公司想要的报告格式或客户应答方式,还需要单独教。就像公司把写有标准答案的工作手册交给员工照着做一样,监督微调会反复向模型展示带有正确答案的练习题,让它养成按特定语气、格式或特定领域知识作答的习惯。

最近这项工作的门槛大幅降低。曾经要重新训练大型模型需要昂贵的服务器级设备,但现在只挑选模型的一部分进行低成本再训练的节省型方法逐渐普及,使得一张游戏显卡就能训练出270亿参数规模的模型。因此,个人或小团队亲自打造针对特定语言或领域的定制模型的案例正在增加。

在报道中是这样出现的

文章中常以SFT或“监督学习(SFT)”这样的缩写形式出现。Qwen3.8-27B的训练指南中说明,“如果只用文本数据做监督学习(SFT),只需准备一个用Qwen对话模板渲染出text列的数据集即可”;而在法语专用模型Luth-2的报道中提到,团队新构建了一套涵盖数学、知识、代码、工具调用、多轮对话等内容、规模达30亿token的监督学习(SFT)数据集。常见的一个误解是,监督微调并不是从零开始构建模型的过程,而是对已经具备基础能力的模型进行打磨的后续阶段。

亲手试一试

  1. 找一个问答配对的公开数据集。
  2. 打开一个可免费使用的训练用notebook环境,选择想要重新训练的开源模型。
  3. 将数据集整理成模型所要求的对话格式。
  4. 执行监督微调,让模型学习按照新示例作答。
  5. 保存训练完成的模型,亲自提问,看看它的回答方式发生了怎样的变化。

相关词条

出现过这个词的报道

浏览全部词条