
이미지: METAL
요약
- 애플 리서치가 멀티모달 LLM의 선호 정렬(preference alignment) 방법을 종합 분석한 논문을 발표했다
- 오프라인(DPO)과 온라인(online-DPO) 정렬 방식을 결합하면 특정 상황에서 성능이 개선된다는 점을 확인했다
- 추가 주석이나 외부 모델 없이 선호 데이터를 만드는 'BDHS' 기법을 새로 제안하고 기존 기법과 경쟁력 있는 성능을 보였다
- 발표
- Apple ML Research, 2026년 8월 3일
- 논문 제목
- Understanding Alignment in Multimodal LLMs: A Comprehensive Study
- 핵심 제안 기법
- Bias-Driven Hallucination Sampling(BDHS)
- 비교 대상
- 오프라인 정렬(DPO), 온라인 정렬(online-DPO)
- 저자 규모
- Elmira Amirloo 등 11명(애플 소속)
이미지 보고도 딴소리하는 AI, 왜일까
애플 리서치가 8월 3일 공개한 논문은 멀티모달 대형언어모델(MLLM·이미지와 텍스트를 함께 이해하는 AI)이 왜 사진 속 내용과 다른 말을 하는지, 그리고 이를 어떻게 줄일 수 있는지를 다뤘다. 텍스트만 다루는 언어모델도 사실과 다른 말을 지어내는 '환각' 문제를 겪지만, 이미지까지 다루는 모델은 한 겹 더 복잡하다. 틀린 사실을 말하는 것에 더해 사진에 없는 내용을 지어내는 경우까지 생기기 때문이다. 애플은 이를 줄이는 학습 방식인 '선호 정렬(preference alignment)'을 정면으로 파헤쳤다.
정렬이라는 오래된 숙제, 멀티모달에선 아직 미완
선호 정렬은 AI가 내놓은 여러 답변 중 사람이 더 선호하는 답변을 골라 그쪽으로 모델을 조금씩 끌어당기는 학습법이다. 챗GPT류 텍스트 모델에서는 이미 널리 쓰이는 기법이지만, 이미지까지 다루는 멀티모달 모델에서는 상대적으로 덜 연구됐다는 게 이번 논문의 출발점이다. 그동안 여러 연구팀이 각자 다른 데이터셋과 기반 모델, 정렬 방법(DPO, PPO 등)으로 성능 개선을 보고했지만, 정작 무엇이 개선의 진짜 원인인지는 뒤섞여 있었다. 애플 연구진은 정렬 알고리즘을 미리 다 만들어둔 답변 쌍으로 학습하는 '오프라인' 방식과, 학습 중 실시간으로 답변을 생성해가며 조정하는 '온라인' 방식으로 나눠 각각의 효과를 따로 떼어 분석했다. 그 결과 두 방식을 함께 쓰면 특정 상황에서 성능이 더 좋아진다는 점을 확인했다. 논문은 여기서 한 걸음 더 나아가 기존에 공개된 여러 멀티모달 선호 데이터셋의 구성 방식이 실제 성능에 어떻게 영향을 미치는지도 짚었다.
즈푸, 이미지-텍스트 변환 모델 GLM-OCR 공개
사람 손 없이 만드는 학습 데이터, BDHS
이번 논문에서 가장 눈에 띄는 제안은 'Bias-Driven Hallucination Sampling(BDHS)'라는 새 데이터 생성법이다. 기존 방식은 사람이 직접 어느 답변이 더 정확한지 표시하거나 별도의 외부 AI 모델을 동원해 선호 데이터를 만드는 경우가 많았다. 둘 다 시간과 비용이 든다. BDHS는 이런 추가 작업 없이도 모델 자체의 편향을 활용해 선호 데이터를 만들어내는 방식으로, 애플은 여러 벤치마크에서 기존에 발표된 정렬 기법들과 견줄 만한 성능을 냈다고 밝혔다.
그래서 무엇이 달라지나
이번 연구는 멀티모달 AI를 만드는 개발팀에게 실질적인 참고서 역할을 할 것으로 보인다. 지금까지는 정렬 성능이 좋아졌다는 발표가 나와도 그게 데이터셋 덕인지, 알고리즘 덕인지 구분하기 어려웠다. 애플이 각 요소를 분리해 비교표를 내놓은 만큼, 후속 연구자들은 어떤 조합이 비용 대비 효과가 큰지 가늠할 기준을 얻은 셈이다. 특히 사람의 수작업 없이 선호 데이터를 만드는 BDHS 접근은, 정렬 학습에 드는 비용을 낮추려는 오픈소스 진영에서도 참고할 여지가 있다.





댓글