每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 术语词典S使用中会遇到的词

SORRY-Bench

AI 모델이 위험하거나 부적절할 수 있는 요청을 얼마나 잘 거절하는지 재는 안전성 시험 중 하나

该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。

简单来说

SORRY-Bench는 언어모델에게 여러 문항을 던져놓고, 위험할 수 있는 요청을 얼마나 잘 걸러내는지 채점하는 시험이다. 마치 수많은 손님을 상대하는 편의점 알바생에게 '술 살 것 같은 미성년자를 얼마나 잘 걸러내는가'를 시험하는 것과 비슷하다.

그런데 이 시험에는 허점이 있었다. 손님을 지나치게 의심해서 성인까지 다 돌려보내면 오히려 '잘 걸러낸다'는 점수가 올라가버리는 식이다. 실제로 위험한지 아닌지 정교하게 판단하는 능력이 아니라, 그냥 무조건 조심스럽게 거절하기만 해도 점수가 오를 수 있다는 게 최근 연구로 드러났다.

그래서 이 시험을 짧게 줄이는 방법도 함께 연구됐다. 문제 5000여 개 중 실제로 모델 간 차이를 보여주는 문항은 일부뿐이라, 약 10문항만 골라 쓰면 비용을 크게 줄이면서도 전체 시험과 비슷한 결과를 얻을 수 있었다.

在报道中是这样出现的

기사에서는 "HarmBench, OR-Bench-Hard, SORRY-Bench 같은 안전 벤치마크"라는 식으로 다른 안전성 시험들과 묶여 언급된다. 오해하기 쉬운 점은, 이 시험 점수가 높다고 해서 모델이 정말 안전하게 판단력이 좋다는 뜻이 아니라는 것이다. 그저 요청을 더 자주 거절하기만 해도 점수가 오를 수 있어, 실제 유용성과는 오히려 반비례하는 경우도 있다.

相关词条

出现过这个词的报道

浏览全部词条