AI GlossaryㅎWords you meet while using AI
HarmBench
언어모델이 위험할 수 있는 요청을 얼마나 잘 거절하는지 채점하는 AI 안전 시험지
This entry has not been translated yet — it is shown in Korean. The translation attaches automatically once it lands.
In plain words
HarmBench는 언어모델에 일부러 위험한 질문을 던져보고, 모델이 그 요청을 거절하는지 아닌지를 채점하는 표준 시험지다. 마치 은행 직원에게 수상한 요구를 하는 손님 역할극을 시켜서, 직원이 규정대로 거절하는지 테스트하는 것과 비슷하다.
문제는 이 시험이 '거절을 얼마나 자주 하느냐'만 잰다는 점이다. 무조건 의심하고 다 막는 직원이 점수를 잘 받는 구조라, 실제로 손님을 얼마나 잘 응대하는지는 이 시험만으로 알 수 없다. 최근 연구에서는 이 점수가 높은 모델일수록 정작 무해한 질문까지 지나치게 막아버리는 경향이 함께 나타났다.
그래서 개발사들은 HarmBench 하나만 보지 않고, 반대로 '과도하게 막지 않는지'를 재는 다른 시험과 함께 놓고 비교하는 식으로 균형을 맞추려 한다.
How it shows up in the news
기사는 "HarmBench는 유해한 요청을 거절할수록 점수를 준다"고 설명하며, 이 점수가 높다고 해서 모델이 무조건 더 안전하거나 더 쓸모 있는 건 아니라고 지적한다. 흔한 오해는 HarmBench 점수가 높으면 '안전한 모델'이라는 인증서로 여기는 것인데, 실제로는 거절 성향 하나만 보여줄 뿐 정직성이나 과잉 검열 여부는 별개로 확인해야 한다.
See also
Stories using this term
- AI Safety Scores Can Be Gamed Just by Refusing MoreModels · 2026.08.22
- Tencent's Zhuque Lab Open-Sources AI Agent/MCP Security ScannerProducts · 2026.08.21
- OpenAI tightens monitoring and isolation after Hugging Face incidentBusiness · 2026.08.19
- Hume AI Measures Benchmark Memorization in Speech Recognition ModelsModels · 2026.08.22
- OpenAI disbands catastrophic-risk team, scatters its work across departmentsBusiness · 2026.08.16
- Open Secure AI Alliance Proposes SAFE GuidelinesBusiness · 2026.08.09