하름벤치
HarmBench
언어모델이 위험할 수 있는 요청을 얼마나 잘 거절하는지 채점하는 AI 안전 시험지
该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。
简单来说
HarmBench는 언어모델에 일부러 위험한 질문을 던져보고, 모델이 그 요청을 거절하는지 아닌지를 채점하는 표준 시험지다. 마치 은행 직원에게 수상한 요구를 하는 손님 역할극을 시켜서, 직원이 규정대로 거절하는지 테스트하는 것과 비슷하다.
문제는 이 시험이 '거절을 얼마나 자주 하느냐'만 잰다는 점이다. 무조건 의심하고 다 막는 직원이 점수를 잘 받는 구조라, 실제로 손님을 얼마나 잘 응대하는지는 이 시험만으로 알 수 없다. 최근 연구에서는 이 점수가 높은 모델일수록 정작 무해한 질문까지 지나치게 막아버리는 경향이 함께 나타났다.
그래서 개발사들은 HarmBench 하나만 보지 않고, 반대로 '과도하게 막지 않는지'를 재는 다른 시험과 함께 놓고 비교하는 식으로 균형을 맞추려 한다.
在报道中是这样出现的
기사는 "HarmBench는 유해한 요청을 거절할수록 점수를 준다"고 설명하며, 이 점수가 높다고 해서 모델이 무조건 더 안전하거나 더 쓸모 있는 건 아니라고 지적한다. 흔한 오해는 HarmBench 점수가 높으면 '안전한 모델'이라는 인증서로 여기는 것인데, 실제로는 거절 성향 하나만 보여줄 뿐 정직성이나 과잉 검열 여부는 별개로 확인해야 한다.