매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

AI 용어사전처음 만나는 말

강화학습

Reinforcement Learning

잘하면 보상, 못하면 감점을 주며 시행착오로 가르치는 훈련법. 알파고를 만든 그 방법.

쉽게 말하면

정답지를 주는 대신, 해 보게 하고 잘하면 보상·못하면 감점을 주는 훈련법입니다. 강아지 훈련과 원리가 같습니다 — 「앉아」에 앉으면 간식, 수백만 번 반복.

알파고가 이 방식으로 바둑을 정복했고, 요즘은 언어 모델 훈련의 핵심이 됐습니다. 수학 문제를 풀게 하고 정답이면 보상을 주는 식으로 추론 능력을 기릅니다. 「강화학습으로 추론 성능을 끌어올렸다」는 최신 모델 발표의 단골 문구입니다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기