강화학습
Reinforcement Learning
잘하면 보상, 못하면 감점을 주며 시행착오로 가르치는 훈련법. 알파고를 만든 그 방법.
쉽게 말하면
정답지를 주는 대신, 해 보게 하고 잘하면 보상·못하면 감점을 주는 훈련법입니다. 강아지 훈련과 원리가 같습니다 — 「앉아」에 앉으면 간식, 수백만 번 반복.
알파고가 이 방식으로 바둑을 정복했고, 요즘은 언어 모델 훈련의 핵심이 됐습니다. 수학 문제를 풀게 하고 정답이면 보상을 주는 식으로 추론 능력을 기릅니다. 「강화학습으로 추론 성능을 끌어올렸다」는 최신 모델 발표의 단골 문구입니다.