METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅈ报道中常见的技术词

直接偏好优化(DPO)

Direct Preference Optimization

不是让模型死记一个标准答案,而是通过比较两个结果哪个更好来重新训练模型的方法。

简单来说

直接偏好优化(DPO)是一种只靠“比较”来重新训练模型的方法:把模型给出的两个结果放在一起,判断哪一个更好,据此调整模型,而不是先定好一个标准答案让模型去命中。面对同一个问题的两个答案,训练时只需要挑出哪一个更自然、更好用即可。

用烹饪比赛的评审来类比会更好理解。评委不必给每道菜打具体分数,只要说“这道菜比那道好”,厨师就知道该往哪个方向改进了。DPO也是同样的原理:收集大量这样的比较数据,直接把模型往“被判定为更好的那一方”靠拢。当人工逐一比较不够用时,也可以让另一个AI模型充当评委来代替人工比较。

这种方法尤其适合那些没有唯一标准答案的问题,比如打磨拼接出来的音乐或文章听起来是否自然流畅。当基础训练只能让语法正确、但完成度不够理想时,再加一轮DPO训练就能进一步提升结果的质量。

在报道中是这样出现的

文章中提到,一名独立开发者在制作钢琴自动补全模型时,用Gemini 3.5 Flash比较两段补全内容哪个更好,据此收集偏好数据并用于DPO训练。结果显示,模型的输出被判定优于基础模型的比例超过了69%。容易被误解的一点是:DPO并不是让模型“更准确地命中答案”的训练,而是让模型“更接近被判定为更好的一方”的训练。完成度和准确性是两个不同的评判标准。

相关词条

出现过这个词的报道

浏览全部词条