
이미지: METAL LAB 생성
摘要
- 苹果研究院发布了一篇全面分析多模态大语言模型偏好对齐方法的论文
- 研究证实,结合离线(DPO)与在线(online-DPO)对齐方式,在特定情况下能提升性能
- 研究团队还提出了无需额外标注或外部模型即可生成偏好数据的新技术"BDHS",其表现可与现有方法媲美
- 발표
- Apple ML Research, 2026년 8월 3일
- 논문 제목
- Understanding Alignment in Multimodal LLMs: A Comprehensive Study
- 핵심 제안 기법
- Bias-Driven Hallucination Sampling(BDHS)
- 비교 대상
- 오프라인 정렬(DPO), 온라인 정렬(online-DPO)
- 저자 규모
- Elmira Amirloo 등 11명(애플 소속)
看着图片却答非所问的AI,问题出在哪
苹果研究院于8月3日发布的论文,探讨了多模态大语言模型(MLLM,即同时理解图像与文本的AI)为何会给出与图片内容不符的回答,以及如何减少这种情况。仅处理文本的语言模型也存在编造与事实不符内容的"幻觉"问题,但同时处理图像的模型则更复杂一层——除了说错事实之外,还可能出现编造图片中并不存在的内容的情况。苹果正面剖析了用于减少这一问题的训练方法——"偏好对齐(preference alignment)"。
对齐这道老难题,在多模态领域仍未完成
偏好对齐是一种训练方法:从AI给出的多个答案中挑选出人类更偏好的答案,并借此逐步引导模型向该方向调整。这项技术在ChatGPT类文本模型中已被广泛应用,但本论文指出,在同时处理图像的多模态模型中,相关研究相对较少。此前,多个研究团队分别使用不同的数据集、基础模型和对齐方法(如DPO、PPO等)报告了性能提升,但究竟哪个才是提升的真正原因,一直众说纷纭。苹果研究团队将对齐算法分为两类分别分析:一类是"离线"方式,即用预先构建好的答案对进行训练;另一类是"在线"方式,即在训练过程中实时生成答案并进行调整。结果发现,将两种方式结合使用,在特定情况下能带来更好的性能。论文还进一步探讨了现有公开的多模态偏好数据集的构建方式如何实际影响性能表现。
无需人工标注即可生成训练数据:BDHS
本论文中最引人注目的提议,是一种名为"Bias-Driven Hallucination Sampling(BDHS)"的新数据生成方法。以往的方法多需要人工直接标注哪个答案更准确,或借助额外的外部AI模型来生成偏好数据,这两种方式都需要投入时间和成本。BDHS无需这类额外工作,而是利用模型自身的偏差来生成偏好数据。苹果表示,该方法在多项基准测试中的表现可与现有已发表的对齐技术相媲美。
这意味着什么
这项研究有望为开发多模态AI的团队提供实用的参考。此前,即便有人宣称对齐性能有所提升,也很难判断这究竟是数据集的功劳,还是算法的功劳。由于苹果对各个要素进行了拆分并给出了对比结果,后续研究者由此获得了一个可以衡量哪种组合性价比更高的基准。尤其是BDHS这种无需人工标注即可生成偏好数据的方法,对于希望降低对齐训练成本的开源阵营而言,也具有参考价值。



