GRPO
Group Relative Policy Optimization
같은 질문에 대한 여러 답을 한 그룹으로 묶어 상대적으로 비교하며 점수를 매기는 강화학습 훈련 기법
该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。
简单来说
GRPO는 AI 모델을 강화학습으로 훈련시킬 때, 한 문제에 여러 개의 답안을 한꺼번에 만들어보고 그 안에서 서로 비교해 점수를 매기는 방법이다.
비유하자면 이렇다. 한 반의 학생 여러 명이 같은 문제를 풀었다고 하자. 선생님이 정답지와 하나하나 대조하는 대신, 학생들의 답안을 나란히 놓고 "이 중에서는 이 답이 상대적으로 낫다"는 식으로 순위를 매겨 점수를 준다. GRPO도 똑같다. 같은 질문에 대해 AI가 답을 여러 번 만들면, 그 답들을 그룹으로 묶어 서로 비교해서 잘한 답에는 더 높은 점수를, 못한 답에는 낮은 점수를 주고 그 차이를 이용해 모델을 조금씩 고쳐나간다.
이 방식의 장점은 별도로 채점 기준을 익히는 모델을 하나 더 훈련시키지 않아도 된다는 점이다. 그룹 안에서 상대 비교만으로 점수를 정하니 훈련 과정이 가볍고, 그래서 최근 오픈소스 언어모델들이 코딩이나 도구 사용 같은 실전 능력을 가르칠 때 즐겨 쓰는 방법으로 자리잡았다.
在报道中是这样出现的
IBM의 그래닛 4.2 개발 기사에서는 "각 단계는 이전 단계의 체크포인트에서 이어받는 별도의 GRPO(그룹상대정책최적화)로 훈련한다"는 식으로 등장한다. 여기서 오해하기 쉬운 점은, GRPO가 하나의 최종 훈련 단계가 아니라 수학·코드·도구 사용 등 여러 단계마다 각각 적용되는 반복적인 기법이라는 것이다.