每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 용어사전R처음 만나는 말

RLHF

인간 피드백 강화학습

사람이 매긴 「좋은 답」 점수로 모델의 말버릇을 다듬는 훈련. 챗GPT를 공손하게 만든 기술.

쉽게 말하면

Reinforcement Learning from Human Feedback — 사람의 평가를 보상으로 쓰는 강화학습입니다. 모델이 낸 답 여러 개를 사람이 「이게 더 낫다」고 고르면, 그 선호를 점수 삼아 모델의 말버릇을 다듬습니다.

GPT-3가 챗GPT가 될 때 결정적이었던 기술입니다. 아는 것은 비슷해도 「공손하게, 도움이 되게, 위험하지 않게」 답하는 태도가 여기서 만들어졌습니다. 사람 취향에 너무 맞추다 아부성 답변이 는다는 부작용 논쟁도 따라다닙니다.

직접 해보기

  1. 챗봇 답변 아래의 👍/👎 버튼을 찾아보세요.
  2. 마음에 든 답에 👍를 눌러 봅니다 — 지금 하신 그 행동이 RLHF의 재료입니다. 수많은 사용자의 이 선택이 모여 「사람들이 선호하는 답」의 방향을 정합니다.
  3. 챗봇이 유난히 칭찬과 맞장구가 많다고 느껴진다면, 그것도 사람들의 👍가 만든 성격입니다 — 「AI 아부 논쟁」이 왜 나오는지까지 함께 이해됩니다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기