자연어 루브릭
Natural Language Rubric
AI 답변이 잘됐는지 사람이 문장으로 미리 적어둔 채점 기준으로, 이후 자동으로 같은 기준을 적용해 평가하는 방식
쉽게 말하면
자연어 루브릭은 AI가 내놓은 답을 채점할 때 쓰는, 사람이 문장으로 써둔 기준표예요. 학교 시험에서 선생님이 "이 조건을 충족하면 3점, 저 조건까지 만족하면 5점"이라고 미리 정해두면 채점이 훨씬 공정하고 빨라지죠. 자연어 루브릭도 똑같아요. "에이전트가 사용자의 요청을 먼저 되물었는가" "필요한 정보를 빠뜨리지 않고 전달했는가" 같은 기준을 문장으로 적어두면, 그 기준에 맞춰 답을 자동으로 채점할 수 있어요.
이게 특히 필요한 경우는 정답이 하나로 딱 정해지지 않을 때예요. 예를 들어 음성으로 대화하는 AI는 같은 의미를 수백 가지 다른 말투로 표현할 수 있어요. "네, 알겠습니다"와 "확인했어요, 처리할게요"는 단어는 다르지만 둘 다 맞는 응답일 수 있죠. 이럴 때 정답 문장을 하나로 고정해 비교하는 방식은 소용이 없어요. 대신 사람이 판단 기준을 문장으로 한 번 적어두면, 그 기준을 새로운 대화마다 반복해서 자동으로 들이대볼 수 있어요.
결국 자연어 루브릭은 사람이 손으로 하나하나 듣고 판단하던 일을 대신해주는 도구예요. 사람이 세운 기준은 그대로 유지되면서, 반복되는 검증 작업만 기계가 대신 처리하는 셈이죠.
기사에서 이렇게 나와요
기사는 "채점은 자연어 루브릭으로 이뤄져요… 사람이 한 번 판단 기준을 문장으로 적어두면 이후 모든 대화에 자동으로 같은 기준이 적용돼요"라고 설명해요. 여기서 오해하기 쉬운 부분은, AI가 스스로 정답이 뭔지 판단한다는 뜻이 아니라는 점이에요. 정답의 기준은 여전히 사람이 문장으로 정해두고, AI는 그 기준을 매번 새로운 대화에 일관되게 적용하는 역할만 해요.
