익스플로잇벤치
ExploitBench
오픈AI가 AI 모델의 해킹·보안 취약점 공격 능력을 채점하는 자체 평가용 시험지
쉽게 말하면
익스플로잇벤치는 AI 모델이 얼마나 잘 해킹을 할 수 있는지 확인하는 오픈AI의 시험이다. 학생에게 여러 문제를 풀게 하고 점수를 매기는 시험지처럼, 가상의 컴퓨터 시스템에 숨겨진 약점을 찾아내고 실제로 뚫어보라는 과제를 여러 개 던져준 뒤 몇 개나 성공하는지를 채점하는 방식이다.
이 시험에서 만점을 받았다는 건 그 모델이 사람의 도움 없이도 컴퓨터 시스템의 알려지지 않은 약점을 찾아 실제 공격까지 해낼 수 있다는 뜻이다. 오픈AI는 신모델 아스트라가 이 시험에서 만점을 받았다고 밝혔는데, 이는 동시에 그 모델을 위험한 목적으로 오용할 수 있는 능력이기도 해서 안전 등급을 매기는 근거로 쓰인다.
다만 이 시험은 오픈AI가 자체적으로 만들고 채점한 것이다. 외부 기관이 독립적으로 확인한 결과는 아니라는 점을 기사에서 눈여겨봐야 한다.
