直接偏好优化(DPO)
Direct Preference Optimization
不是让模型死记一个标准答案,而是通过比较两个结果哪个更好来重新训练模型的方法。
简单来说
直接偏好优化(DPO)是一种只靠“比较”来重新训练模型的方法:把模型给出的两个结果放在一起,判断哪一个更好,据此调整模型,而不是先定好一个标准答案让模型去命中。面对同一个问题的两个答案,训练时只需要挑出哪一个更自然、更好用即可。
用烹饪比赛的评审来类比会更好理解。评委不必给每道菜打具体分数,只要说“这道菜比那道好”,厨师就知道该往哪个方向改进了。DPO也是同样的原理:收集大量这样的比较数据,直接把模型往“被判定为更好的那一方”靠拢。当人工逐一比较不够用时,也可以让另一个AI模型充当评委来代替人工比较。
这种方法尤其适合那些没有唯一标准答案的问题,比如打磨拼接出来的音乐或文章听起来是否自然流畅。当基础训练只能让语法正确、但完成度不够理想时,再加一轮DPO训练就能进一步提升结果的质量。
在报道中是这样出现的
文章中提到,一名独立开发者在制作钢琴自动补全模型时,用Gemini 3.5 Flash比较两段补全内容哪个更好,据此收集偏好数据并用于DPO训练。结果显示,模型的输出被判定优于基础模型的比例超过了69%。容易被误解的一点是:DPO并不是让模型“更准确地命中答案”的训练,而是让模型“更接近被判定为更好的一方”的训练。完成度和准确性是两个不同的评判标准。
