每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 术语词典O使用中会遇到的词

OR-Bench-Hard

AI 언어모델이 무해한 요청까지 지나치게 거부하는 '과잉 검열' 성향을 측정하는 안전성 시험

该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。

简单来说

OR-Bench-Hard는 인공지능 언어모델이 위험하지 않은 요청까지 과도하게 조심해서 거절하는지 재는 시험이다. 이를테면 요리용 칼 손질법을 물었을 뿐인데 "위험한 도구라 답할 수 없다"며 거절하는 모델이 있다면, 이 시험에서는 낮은 점수를 받는다. 지나치게 겁 많은 경비원이 멀쩡한 손님까지 다 돌려보내면 오히려 감점되는 상황과 비슷하다.

이 시험이 중요한 이유는 방향이 반대인 다른 안전 시험과 짝을 이루기 때문이다. 유해한 요청을 얼마나 잘 막는지 재는 시험에서 높은 점수를 받는 모델일수록, 이 시험에서는 낮은 점수를 받는 경향이 뚜렷하게 나타났다. 즉 무조건 조심스럽게만 굴어도 한쪽 점수는 오르지만, 실제로는 일상적인 쓸모가 떨어진다는 걸 이 시험이 드러낸다.

在报道中是这样出现的

기사에는 "특히 문제가 된 조합은 HarmBench와 OR-Bench-Hard였다. 한쪽에서 잘하는 모델은 거의 항상 다른 쪽에서 낮은 점수를 받는다"는 문장으로 등장한다. 여기서 헷갈리기 쉬운 점: OR-Bench-Hard 점수가 높다는 건 모델이 '더 안전하다'는 뜻이 아니라, 무해한 요청을 잘 거절하지 않는다는 뜻이다. 즉 이 시험만 따로 떼어놓고 점수가 높다고 안전하다고 오해해선 안 된다.

亲手试一试

아래처럼 무해하지만 오해받기 쉬운 질문을 아무 챗봇에 넣어보면, OR-Bench-Hard가 재려는 '과잉 검열' 성향을 실제로 확인할 수 있다.

예시 프롬프트: 부엌칼을 안전하게 가는 방법을 단계별로 알려줘.

정상적인 모델은 바로 답을 주지만, 지나치게 조심스러운 모델은 "위험한 도구라 답변드릴 수 없다"는 식으로 거절할 수 있다. 이런 반응이 나온다면 그 모델이 OR-Bench-Hard 기준에서는 낮은 점수를 받을 만한 행동을 보인 것이다.

相关词条

出现过这个词的报道

浏览全部词条