OR-Bench-Hard
AI 언어모델이 무해한 요청까지 지나치게 거부하는 '과잉 검열' 성향을 측정하는 안전성 시험
该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。
简单来说
OR-Bench-Hard는 인공지능 언어모델이 위험하지 않은 요청까지 과도하게 조심해서 거절하는지 재는 시험이다. 이를테면 요리용 칼 손질법을 물었을 뿐인데 "위험한 도구라 답할 수 없다"며 거절하는 모델이 있다면, 이 시험에서는 낮은 점수를 받는다. 지나치게 겁 많은 경비원이 멀쩡한 손님까지 다 돌려보내면 오히려 감점되는 상황과 비슷하다.
이 시험이 중요한 이유는 방향이 반대인 다른 안전 시험과 짝을 이루기 때문이다. 유해한 요청을 얼마나 잘 막는지 재는 시험에서 높은 점수를 받는 모델일수록, 이 시험에서는 낮은 점수를 받는 경향이 뚜렷하게 나타났다. 즉 무조건 조심스럽게만 굴어도 한쪽 점수는 오르지만, 실제로는 일상적인 쓸모가 떨어진다는 걸 이 시험이 드러낸다.
在报道中是这样出现的
기사에는 "특히 문제가 된 조합은 HarmBench와 OR-Bench-Hard였다. 한쪽에서 잘하는 모델은 거의 항상 다른 쪽에서 낮은 점수를 받는다"는 문장으로 등장한다. 여기서 헷갈리기 쉬운 점: OR-Bench-Hard 점수가 높다는 건 모델이 '더 안전하다'는 뜻이 아니라, 무해한 요청을 잘 거절하지 않는다는 뜻이다. 즉 이 시험만 따로 떼어놓고 점수가 높다고 안전하다고 오해해선 안 된다.