강화학습
Reinforcement Learning
잘하면 보상, 못하면 감점을 주며 시행착오로 가르치는 훈련법. 알파고를 만든 그 방법.
쉽게 말하면
정답지를 주는 대신, 해 보게 하고 잘하면 보상·못하면 감점을 주는 훈련법입니다. 강아지 훈련과 원리가 같습니다 — 「앉아」에 앉으면 간식, 수백만 번 반복.
알파고가 이 방식으로 바둑을 정복했고, 요즘은 언어 모델 훈련의 핵심이 됐습니다. 수학 문제를 풀게 하고 정답이면 보상을 주는 식으로 추론 능력을 기릅니다. 「강화학습으로 추론 성능을 끌어올렸다」는 최신 모델 발표의 단골 문구입니다.
함께 볼 용어
이 용어가 나온 기사
- 로봇 팔 움직임, 다이얼처럼 속도 조절하는 학습법 나왔다Research · 2026.08.11
- 다이나 로보틱스, 인간 영상 100만시간 학습한 로봇모델 공개Models · 2026.08.11
- Unsloth, 로컬에서 학습까지 되는 데스크톱 앱 공개Products · 2026.08.12
- NVIDIA, 비전-언어 대신 영상으로 배우는 로봇 정책 제시Research · 2026.08.09
- 사카나AI, 로봇이 스스로 배우는 '물리 AI'에 재귀적 자기개선 도입Research · 2026.08.11
- Oumi, 프로덕션 로그로 스스로 학습하는 LLM 플랫폼 공개Products · 2026.08.12