터미널벤치 3.0
TerminalBench 3.0
AI가 터미널(명령줄)에서 스스로 코딩 문제를 해결하는 능력을 겨루는 시험용 벤치마크.
쉽게 말하면
터미널벤치 3.0은 AI 모델이 터미널이라는, 글자로만 명령을 입력하는 화면 안에서 실제 개발자처럼 코딩 작업을 얼마나 잘 해내는지 겨루는 시험이에요. 문제 상황을 던져주면 AI가 스스로 명령어를 입력해 해결하고, 그 결과가 맞았는지를 채점해 점수를 매겨요.
비유하자면 요리사에게 레시피도, 버튼 달린 조리기구도 없이 재료 창고 하나만 던져주고 그 안에서 손으로 직접 요리를 완성하게 시킨 다음, 완성된 요리가 얼마나 정확한지 심사하는 대회 같은 거예요. 화면 속 메뉴나 아이콘을 클릭하는 게 아니라 오직 글자로만 작업을 지시해야 하니, AI가 사람의 도움 없이 얼마나 자율적으로 문제를 풀어내는지를 순수하게 잴 수 있어요.
이 점수는 코딩을 돕는 AI 도구들의 실력을 비교할 때 자주 인용돼요. 점수가 높을수록 복잡한 개발 업무를 사람 개입 없이 스스로 끝까지 처리할 수 있다는 뜻이에요.
기사에서 이렇게 나와요
기사에서는 큐원3.8-맥스-0902가 터미널벤치 3.0에서 29.0점을 받아 이전 버전(11.3점)보다 크게 올랐지만, 클로드 오퍼스5의 42.7점에는 여전히 못 미친다고 나와요. 여기서 오해하기 쉬운 점은, 이 점수가 낮다고 해서 AI의 코딩 능력 전체가 떨어진다는 뜻은 아니라는 거예요. 터미널벤치 3.0은 여러 코딩 지표 중 하나로, 터미널 환경에서 스스로 작업을 완결하는 자율성만 따로 재는 시험이에요. 같은 기사에서 큐원이 자체 벤치마크인 QwenSWEBench V2에서는 클로드 오퍼스5를 앞선 것처럼, 시험 종류에 따라 순위가 달라질 수 있어요.
