METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅈ기사에 자주 나오는 기술 용어

직접 선호도 최적화 (DPO)

Direct Preference Optimization

정답 하나를 맞히게 하는 대신 두 결과물 중 어느 쪽이 더 나은지 비교시켜 모델을 그 방향으로 다시 훈련하는 방법.

쉽게 말하면

직접 선호도 최적화(DPO)는 AI가 내놓은 여러 결과물 가운데 어느 쪽이 더 나은지 비교만으로 모델을 다시 훈련시키는 방법이다. 정답을 하나 정해두고 맞히라고 가르치는 방식과 달리, 같은 질문에 대한 두 개의 답을 나란히 놓고 어느 쪽이 더 자연스럽거나 쓸만한지 골라주는 식으로 훈련한다.

요리 대회 심사에 비유하면 이해가 쉽다. 심사위원이 요리마다 점수를 매기는 대신 "이 접시가 저 접시보다 낫다"고 순위만 매겨도 요리사는 다음에 어느 방향으로 손을 봐야 할지 알 수 있다. DPO도 이런 비교 데이터를 잔뜩 모아, 모델이 앞으로 '더 낫다고 뽑힌 쪽'과 비슷한 답을 내놓도록 직접 방향을 조정한다. 사람이 일일이 비교하기 힘들 때는 다른 AI 모델을 심사위원처럼 세워 대신 비교시키기도 한다.

이 방식은 정답이 하나로 딱 떨어지지 않는 문제, 이를테면 이어붙인 음악이나 글이 얼마나 자연스러운지를 다듬을 때 특히 쓰인다. 기본 훈련만으로는 문법은 익혀도 완성도가 아쉬울 때, DPO 단계를 한 번 더 거쳐 결과물의 질을 끌어올리는 식이다.

기사에서 이렇게 나와요

기사에서는 1인 개발자가 피아노 자동완성 모델을 만들면서, Gemini 3.5 Flash로 두 완성본 중 어느 쪽이 나은지 비교시켜 선호도 데이터를 모으고 이를 DPO 학습에 썼다고 설명한다. 그 결과 베이스 모델보다 낫다고 선택된 비율이 69%를 넘었다. 오해하기 쉬운 점은, DPO가 '정답을 더 정확히 맞히는' 훈련이 아니라 '더 나은 쪽에 가까워지는' 훈련이라는 것이다. 완성도와 정확성은 서로 다른 기준으로 다뤄진다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기