RLHF
인간 피드백 강화학습
사람이 매긴 「좋은 답」 점수로 모델의 말버릇을 다듬는 훈련. 챗GPT를 공손하게 만든 기술.
쉽게 말하면
Reinforcement Learning from Human Feedback — 사람의 평가를 보상으로 쓰는 강화학습입니다. 모델이 낸 답 여러 개를 사람이 「이게 더 낫다」고 고르면, 그 선호를 점수 삼아 모델의 말버릇을 다듬습니다.
GPT-3가 챗GPT가 될 때 결정적이었던 기술입니다. 아는 것은 비슷해도 「공손하게, 도움이 되게, 위험하지 않게」 답하는 태도가 여기서 만들어졌습니다. 사람 취향에 너무 맞추다 아부성 답변이 는다는 부작용 논쟁도 따라다닙니다.
직접 해보기
- 챗봇 답변 아래의 👍/👎 버튼을 찾아보세요.
- 마음에 든 답에 👍를 눌러 봅니다 — 지금 하신 그 행동이 RLHF의 재료입니다. 수많은 사용자의 이 선택이 모여 「사람들이 선호하는 답」의 방향을 정합니다.
- 챗봇이 유난히 칭찬과 맞장구가 많다고 느껴진다면, 그것도 사람들의 👍가 만든 성격입니다 — 「AI 아부 논쟁」이 왜 나오는지까지 함께 이해됩니다.
함께 볼 용어
이 용어가 나온 기사
- llama.cpp, AMD ROCm 7.14용 CI 빌드 타깃 추가产品 · 2026.08.11
- LTX, 프레임 단위 실시간 스트리밍으로 '끊김 없는 아바타' 구현产品 · 2026.08.15
- AWS, AgentCore 게이트웨이에 AI 트래픽 속도 제한 기능 추가产品 · 2026.08.09
- vLLM 리드 메인테이너, 50만 GPU 규모 오픈모델 운영 경험 공개模型 · 2026.08.09
- LiteLLM 공급망 공격으로 2,500개 조직 자격증명 유출商业 · 2026.08.13
- 딥시크 v4 플래시 0731, RTX 4090·테슬라 P40 조합으로 로컬 구동 성공模型 · 2026.08.10