터미널 벤치 4.0
Terminal-Bench 4.0
AI 모델이 컴퓨터 명령줄에서 실제 작업을 얼마나 잘 처리하는지 점수로 매기는 시험 세트
쉽게 말하면
터미널 벤치 4.0은 AI 모델을 검은 화면에 글자만 입력하는 방식의 컴퓨터 작업 환경에 앉혀놓고, 실제로 파일을 찾고 프로그램을 설치하고 문제를 고치는 임무를 얼마나 잘 해내는지 채점하는 시험이에요. 사람으로 치면 신입 개발자에게 실제 컴퓨터를 주고 '이 오류 좀 고쳐봐'라고 시킨 뒤 결과로 실력을 매기는 것과 비슷해요.
이 점수가 중요한 이유는 회사들이 새 모델을 내놓을 때 '이전 모델보다 얼마나 똑똑해졌는지'를 말로만 주장하지 않고 이 시험 점수로 증명하기 때문이에요. 다만 점수는 절대적인 지능 측정치가 아니라, 모델에 걸린 안전장치가 얼마나 개입하느냐에 따라서도 달라질 수 있어요.
