탐퍼벤치
TamperBench
오픈웨이트 AI 모델의 안전장치가 파인튜닝이나 조작에 얼마나 쉽게 무너지는지 시험하는 벤치마크.
쉽게 말하면
탐퍼벤치는 AI 모델에 심어진 "이런 건 하지 마" 안전장치가 사용자 손에서 얼마나 쉽게 사라지는지 시험하는 검사표예요. 자물쇠 달린 상자를 여러 사람에게 나눠 주고 그 자물쇠를 얼마나 쉽게 딸 수 있는지 다양한 방법으로 찔러 보는 시험이라고 생각하면 돼요.
캐나다 워털루대학교와 AI 안전 연구단체 FAR.AI가 이끈 국제 연구팀이 이 시험표를 만들었고, 누구나 내려받아 직접 손볼 수 있는 공개 모델 21개를 대상으로 돌려봤어요. 결과는 심각했어요. 모델을 추가로 조금 더 학습시켜 원하는 방향으로 다듬는 과정을 한 번만 거쳐도 대부분 모델의 안전장치가 쉽게 풀려버렸다는 거예요.
이 결과가 중요한 이유는 완성된 AI 파일을 통째로 내려받아 내 컴퓨터에서 마음대로 고칠 수 있다는 특성 자체에 있어요. 그 자유로움 덕분에 값싸게 방어 도구로도 쓸 수 있지만, 똑같은 이유로 만든 회사가 심어 둔 제약까지 누구나 떼어 낼 수 있다는 뜻이거든요. 탐퍼벤치는 이 위험을 구체적인 숫자로 드러내는 잣대예요.
