직접 선호도 최적화 (DPO)
Direct Preference Optimization
정답 하나를 맞히게 하는 대신 두 결과물 중 어느 쪽이 더 나은지 비교시켜 모델을 그 방향으로 다시 훈련하는 방법.
쉽게 말하면
직접 선호도 최적화(DPO)는 AI가 내놓은 여러 결과물 가운데 어느 쪽이 더 나은지 비교만으로 모델을 다시 훈련시키는 방법이다. 정답을 하나 정해두고 맞히라고 가르치는 방식과 달리, 같은 질문에 대한 두 개의 답을 나란히 놓고 어느 쪽이 더 자연스럽거나 쓸만한지 골라주는 식으로 훈련한다.
요리 대회 심사에 비유하면 이해가 쉽다. 심사위원이 요리마다 점수를 매기는 대신 "이 접시가 저 접시보다 낫다"고 순위만 매겨도 요리사는 다음에 어느 방향으로 손을 봐야 할지 알 수 있다. DPO도 이런 비교 데이터를 잔뜩 모아, 모델이 앞으로 '더 낫다고 뽑힌 쪽'과 비슷한 답을 내놓도록 직접 방향을 조정한다. 사람이 일일이 비교하기 힘들 때는 다른 AI 모델을 심사위원처럼 세워 대신 비교시키기도 한다.
이 방식은 정답이 하나로 딱 떨어지지 않는 문제, 이를테면 이어붙인 음악이나 글이 얼마나 자연스러운지를 다듬을 때 특히 쓰인다. 기본 훈련만으로는 문법은 익혀도 완성도가 아쉬울 때, DPO 단계를 한 번 더 거쳐 결과물의 질을 끌어올리는 식이다.
