AA-브리프케이스
AA-Briefcase
평가기관 Artificial Analysis가 만든 비공개 벤치마크로, AI 모델이 장시간 걸리는 지식노동 과제를 얼마나 잘 해내는지 Elo 점수로 매긴다.
쉽게 말하면
AA-브리프케이스는 AI 모델에게 진짜 회사 업무를 맡기고 그 결과물의 질을 채점하는 시험이다. 이름 그대로 서류가방을 들고 출근하는 직장인의 하루를 흉내 낸다고 보면 된다. 짧은 퀴즈를 푸는 게 아니라, 문서를 정리하고 채점 기준에 맞춰 분석하고 보고서 형태로 정리하는, 시간이 오래 걸리는 실무형 작업을 시킨 뒤 결과를 평가한다.
점수는 Elo 방식으로 매겨진다. 체스 기사들의 실력을 서로 겨룬 승패 기록으로 순위 매기듯, 모델들의 결과물을 서로 비교해 서열을 정하는 방식이다. 숫자가 높을수록 문서 구성이나 분석 품질에서 우위를 점했다는 뜻이다.
이 벤치마크는 종합 지능 점수와는 결이 다르다. 어떤 모델은 전반적인 똑똑함 순위에서는 밀려도, 실제 업무 문서를 다루는 이 시험에서는 상위권 모델을 앞지르기도 한다. 사무직 업무를 오래 시켜봐야 드러나는 실력을 따로 재는 셈이다.
기사에서 이렇게 나와요
기사에서는 "장시간 지식노동 과제를 다루는 Artificial Analysis 자체 평가 AA-Briefcase에서 3.7 Flash(high)는 1132 Elo를 기록했다"거나 "모델은 장시간 지식노동 과제를 다루는 비공개 벤치마크 AA-Briefcase에도 처음 등장했다. 여기서 받은 Elo는 1577"처럼 쓰인다. 흔한 오해는 이걸 일반 지능 점수로 착각하는 것인데, AA-Briefcase는 종합 지능지수(Intelligence Index)와 별개로 사무 실무 능력만 따로 측정하는 지표다.
함께 볼 용어
이 용어가 나온 기사
- 아티피셜 애널리시스, 내 데이터로 AI 모델 채점하는 Optima 출시Products · 2026.08.16
- 제미나이 3.7 플래시, 지능 4점 올리고 시간은 줄였다Models · 2026.08.14
- 데이터브릭스, 기업 문서 추론 벤치마크 'OfficeQA Pro V2' 공개Products · 2026.08.12
- Artificial Analysis, 새 AI 벤치마킹 제품군 얼리 액세스 모집Products · 2026.08.11
- Artificial Analysis, 지능 지수 v4.1.1로 채점 모델 교체Research · 2026.08.09
- 스프레드시트 분석 AI 시험서 Claude Opus 5가 54%로 선두Research · 2026.08.12