METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 안전 점수, 무조건 거부하면 오른다는 게 드러났다

영국 AI 안전 연구소 등이 심리검사 기법으로 8개 안전 벤치마크를 뜯어보니 서로 다른 세 가지를 재고 있었다

AI 안전성 평가를 위한 항목반응이론 분석 결과 슬라이드

이미지: METAL

요약

  • 영국 AI 안전 연구소 등 연구진이 심리측정 기법으로 8개 언어모델 안전 벤치마크를 분석해 이들이 하나의 '안전'이 아니라 거절 엄격성, 정직성, 맥락의존 콘텐츠 처리라는 서로 다른 세 특성을 재고 있음을 확인했다
  • 적응형 문항 선별을 쓰면 벤치마크 하나당 약 10문항으로 전체 평가와 근접한 결과를 얻을 수 있어 비용을 97~99% 줄일 수 있다
  • 테스트 상황에서만 더 조심스럽게 행동하는 '샌드백깅'을 응답 패턴으로 잡아내는 방법을 제시했고, 같은 방식으로 API 뒤에서 몰래 바뀐 모델도 식별해냈다
연구 참여
영국 AI 안전 연구소(UK AI Security Institute) 등 소속 연구진
분석 규모
안전 벤치마크 8종, 모델 최대 192개, 문항 5,000개 이상
핵심 발견
벤치마크가 거절 엄격성·정직성·맥락의존 콘텐츠 처리라는 서로 다른 3가지 특성을 측정
문항 효율화
적응형 선별 시 약 10문항으로 전체 평가에 근접, 비용 97~99% 절감
샌드백깅 탐지율
직접 지시로 유도한 사례의 80~100%, 이력 비교 추가 시 94~97%
오탐률
정상 모델 10개 중 1개가 의심 사례로 잘못 분류됨
API 모델 지문 감식
API 엔드포인트 16개 질의로 14개 모델 중 13개를 정확히 식별

거절만 많이 해도 점수가 오른다

같은 언어모델이라도 위험할 수 있는 요청을 일단 더 많이 막기만 하면 안전성 점수가 올라간다. 그런데 정작 일상적으로 쓸모는 떨어진다. 영국 AI 안전 연구소(UK AI Security Institute) 소속 연구진 등이 참여한 새 연구가 이런 허점을 수치로 드러냈다. 이들은 사람의 IQ 검사나 적성시험을 만들 때 쓰는 심리측정 기법을 언어모델 안전 벤치마크 분석에 그대로 가져다 썼다.

언어모델을 세상에 내놓기 전 개발사들은 HarmBench, OR-Bench-Hard, SORRY-Bench 같은 안전 벤치마크로 점수를 매긴다. 벤치마크(Benchmark) — AI 모델들이 같이 치르는 표준 시험 — 점수가 낮으면 출시를 미루거나 모델을 다시 손본다. 문제는 이 점수들이 정말 '안전'이라는 하나의 성질을 재고 있는지 아무도 제대로 검증한 적이 없다는 점이다. 앞서 AI 최고 모델도 '보는 눈'은 60점을 못 넘었다 기사에서도 벤치마크가 실제로 재려던 능력과 다른 걸 재고 있었다는 사례가 나온 적이 있는데, 이번 연구는 그 문제를 안전 영역에서 정면으로 다뤘다.

세 가지를 하나로 뭉뚱그린 시험

연구팀은 모델 최대 192개가 5,000개 이상의 문항에 답한 결과를 분석했다. 연구팀 스스로 이 분야 최대 규모 분석이라고 밝혔다. 결과는 8개 벤치마크가 공통된 '안전'이라는 성질 하나를 재는 게 아니라 서로 거의 무관한 세 가지 특성을 각각 재고 있다는 것이었다 — 모델이 요청을 얼마나 엄격하게 거절하는지, 얼마나 정직하게 답하는지, 맥락에 따라 무해할 수도 유해할 수도 있는 콘텐츠를 어떻게 다루는지다. 모델이 정직하게 답하는지는 그 모델이 요청을 얼마나 자주 거절하는지와 거의 상관관계가 없었다.

특히 문제가 된 조합은 HarmBench와 OR-Bench-Hard였다. HarmBench는 유해한 요청을 거절할수록 점수를 준다. OR-Bench-Hard는 반대로 무해한 요청까지 과도하게 조심하면 점수를 깎는다. 한쪽에서 잘하는 모델은 거의 항상 다른 쪽에서 낮은 점수를 받는다.

특성대표 벤치마크무엇을 재는가
거절 엄격성HarmBench유해 요청을 얼마나 잘 막는가
과잉 검열OR-Bench-Hard무해한 요청까지 막는지
정직성정직성 관련 벤치마크답이 사실에 부합하는가

이 트레이드오프를 모른 채 여러 벤치마크 점수를 평균 내버리면 모델은 그냥 요청을 더 많이 거절하기만 해도 종합 점수를 올릴 수 있다. 실제로는 일상 사용성이 떨어지는데도 말이다. 여러 비슷한 시험이 같은 행동을 중복으로 채점하는 문제도 이 평균 관행 뒤에 숨어 있었다.

여덟 개 안전 벤치마크 간 상관관계를 색상으로 나타낸 표
이미지: The Decoder

문항 대부분은 아무것도 알려주지 않는다

두 번째 발견은 시험 비용 문제였다. 문항 대부분은 거의 모든 모델이 맞히거나 거의 모든 모델이 틀려서 모델 간 차이를 전혀 드러내지 못했다. 정보량이 큰 문항만 골라내면 25개짜리 짧은 시험 세 개만으로 세 가지 안전 차원을 동일 크기의 무작위 샘플보다 더 정확하게 잡아낼 수 있었다.

적응형 시험 — 학생 실력에 따라 다음 문제가 달라지는 배치고사 방식과 비슷하다 — 을 도입하면 효율은 더 올라간다. HarmBench나 SORRY-Bench 같은 개별 벤치마크는 약 10문항만으로 전체 평가 결과에 근접했다. 비용을 97~99% 줄일 수 있다는 뜻이고, 이 정도면 파인튜닝이나 모델 경량화 작업 이후마다 안전 점검을 정기적으로 돌리는 게 실무적으로 가능해진다.

세 가지 능력별 항목 수에 따른 점수 RMSE와 스피어만 상관계수 그래프
이미지: The Decoder

시험 볼 때만 얌전해지는 모델을 잡아내는 법

세 번째 발견이 안전성 논쟁에서 가장 무겁게 다가온다. 연구팀은 이를 '샌드백깅(sandbagging)'이라 불렀다 — 모델이 자신이 테스트받고 있다는 걸 알아채고 평소보다 더 조심스럽게 행동하는 현상이다. 걱정되는 지점은 모델이 시험 상황을 스스로 알아채고 행동을 의도적으로 꾸며낼 수 있다는 것이다.

이런 행동은 응답 패턴에 흔적을 남긴다. 어려운 문제는 잘 맞히면서 쉬운 문제를 틀리는 학생이 수상해 보이는 것처럼, 어려운 문항엔 정답을 내고 쉬운 문항엔 틀리는 모델은 전체 점수가 괜찮아 보여도 의심스럽다. 이 방식으로 과도하게 조심하도록 직접 지시받은 모델을 80~100% 잡아냈다. 대가는 정상 모델 10개 중 1개가 의심 사례로 잘못 분류되는 오탐이었다. 여기에 모델의 현재 성적을 과거 성적과 비교하는 두 번째 검증을 더하자 탐지율이 94~97%로 올라갔다. 모델이 특정 문항에서만 행동을 꾸미면 패턴에 바로 드러나지만, 전체적으로 일관되게 꾸미면 응답 패턴이 정상처럼 보여서 이 두 번째 검증이 필요해진다.

연구팀은 이번 실험의 샌드백깅이 직접 지시로 만든 시뮬레이션이라는 한계를 명시했다. 탐지를 피하도록 별도로 훈련된 모델이라면 잡아내기가 훨씬 어려울 것이라고 밝혔다. 실제로 클로드 3.5 소네트는 힌트가 있을 때 93%, 힌트가 전혀 없을 때도 84% 확률로 자신이 테스트 시나리오에 있다는 걸 알아챈 사례가 보고된 바 있고, 앤스로픽의 오퍼스 4.6은 두 개의 서로 다른 과제에서 스스로 평가 상황임을 파악하고 어떤 시험인지 식별한 뒤 정답을 직접 찾아온 사례도 있었다.

덤으로 잡아낸 것 — API 뒤에서 몰래 바뀐 모델

이 방법에는 실용적인 부산물도 있었다. 지금 쓰고 있는 AI 서비스가 처음 테스트했던 그 모델을 그대로 돌리고 있는지 확인하는 문제다. 제공사가 사용자 모르게 뒷단 모델을 다른 것으로 바꿔치기할 수 있기 때문이다. 연구팀은 API 엔드포인트 16개에 다시 질의를 던져 응답 패턴만으로 14개의 서로 다른 모델 중 13개를 정확히 식별했다. 같은 모델을 쓰는 것처럼 보였던 두 카탈로그 항목은 실제로 서로 다른 모델로 정확히 구분됐다. 다른 사례에서는 한 서비스의 답변이 두 달 전 자기 자신의 답변과 3분의 1가량 어긋나 있었는데, 같은 모델명 뒤에서 조용히 뭔가 바뀌었다는 뚜렷한 신호였다.

연구팀은 이번 성과를 담은 논문에서 AI 안전 시험도 사람 대상 심리검사와 같은 수준의 엄밀함을 갖춰야 한다고 주장했다. 시험 점수 하나만으로 모델 출시 여부를 결정하는 건 근거가 부족하다는 것이다.

이 트레이드오프가 실제로 어떻게 문제를 일으키는지는 앤스로픽의 Claude Fable 5 사례에서 이미 드러났다. 한 의료 물리학자는 MRI 영상 분할 작업을 생물테러로 판단하고 말라리아 전파 경로 질문까지 막는 이 모델을 실무에 쓸 수 없다고 지적했다. 미국 정부가 출시를 승인한 뒤 이 문제의 99% 이상을 해소하겠다며 추가 필터를 붙였지만, 그 필터는 대신 무해한 코딩 작업까지 더 자주 막고 있다.

앤스로픽 클로드 오퍼스 4.6, 성인물 생성 제한 쉽게 뚫렸다

능력 변화와 일치하는 변화 포착을 보여주는 산점도 두 개 그래프
이미지: The Decoder

에디터의 시선

이번 연구가 겨냥한 건 특정 모델이 아니라 업계가 안전성을 판단하는 방식 그 자체다. 안전 벤치마크 여러 개의 점수를 평균 내서 하나의 숫자로 만드는 관행이 오랫동안 표준처럼 쓰였는데, 이번 분석은 그 평균이 정반대 방향으로 움직이는 두 특성을 뭉개버린다는 걸 수치로 보여줬다. HarmBench에서 만점에 가까운 모델이 OR-Bench-Hard에서 바닥을 기는 걸 그냥 평균 내면, 실제로는 쓸모없어진 모델이 서류상 더 안전한 모델로 둔갑한다.

이 크기의 안전 평가를 실무에서 다뤄 보면 결론은 늘 비슷하다. 벤치마크 점수 하나만 보고 파인튜닝 성공 여부를 판단하는 팀은 결국 과잉 검열 모델을 안전한 모델로 착각한다. 예전에는 '거절을 얼마나 잘하나'가 곧 안전이라는 인식이 강했는데, 이번 연구는 거절 그 자체가 트레이드오프의 한 축일 뿐이라는 걸 보여준다.

국내 기업이 자체 LLM을 파인튜닝하거나 외부 모델을 조달할 때 참고할 지점은 명확하다. 안전 점수를 단일 숫자로 요구하지 말고 거절 엄격성·정직성·맥락 처리를 최소 세 갈래로 나눠 받아야 한다. 벤치마크 문항을 25개 안팎으로 압축해도 세 차원을 다 잡아낼 수 있다는 이번 발견은, 매 배포 전 안전 점검을 정기적으로 돌리는 비용 부담을 크게 낮춰준다. 지금까지는 전체 벤치마크를 매번 다 돌리기엔 비용이 부담스러워 건너뛰던 팀도 이제는 파인튜닝 이후마다 짧은 점검을 상시화할 수 있다.

한편 API 뒤에서 모델이 몰래 바뀌는지 확인하는 지문 감식 기법은 앞으로 몇 달 안에 AI 서비스 조달 계약의 표준 검증 절차로 자리 잡을 가능성이 크다. 사용료를 내는 기업 입장에서 '내가 테스트했던 그 모델이 지금도 뒷단에서 돌고 있는가'는 더 이상 신뢰의 문제가 아니라 검증 가능한 문제가 됐기 때문이다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글