RLHF
인간 피드백 강화학습
사람이 매긴 「좋은 답」 점수로 모델의 말버릇을 다듬는 훈련. 챗GPT를 공손하게 만든 기술.
쉽게 말하면
직접 해보기
- 챗봇 답변 아래의 👍/👎 버튼을 찾아보세요.
- 마음에 든 답에 👍를 눌러 봅니다 — 지금 하신 그 행동이 RLHF의 재료입니다. 수많은 사용자의 이 선택이 모여 「사람들이 선호하는 답」의 방향을 정합니다.
- 챗봇이 유난히 칭찬과 맞장구가 많다고 느껴진다면, 그것도 사람들의 👍가 만든 성격입니다 — 「AI 아부 논쟁」이 왜 나오는지까지 함께 이해됩니다.
