
이미지: METAL
요약
- 아티피셜 애널리시스가 사용자 자신의 데이터·워크플로로 맞춤 벤치마크를 만드는 플랫폼 Optima를 출시했다
- 기존 평가 데이터셋 업로드, 에이전트 트레이스 도구 연동, 코딩 세션 스킬 설치 등 세 가지 방식으로 데이터를 모을 수 있다
- 초기 테스터는 재무·회계 에이전트용 벤치마크로 품질 저하 없이 비용을 10분의 1로 줄이는 모델을 찾아냈다
- 제품명
- Optima
- 개발사
- Artificial Analysis
- 핵심 기능
- 사용자 데이터 기반 맞춤 벤치마크 생성 및 모델 비교
- 비교 축
- 품질, 과제당 비용(cost per task), 과제당 시간(time per task)
- 데이터 입력 경로
- 자체 파일·허깅페이스 데이터셋 / Arize·Braintrust·Langfuse 에이전트 트레이스 / 코딩 세션 스킬
- 채점 방식
- 루브릭 기반 평가, 페어와이즈(쌍대 비교) 평가 2종
- 공개 사례
- 재무·회계 에이전트 벤치마크로 비용 10분의 1 절감 모델 발견
벤치마크 점수 하나로는 부족했던 이유
AI 모델을 고를 때 흔히 참고하는 건 지능지수 같은 종합 점수 하나다. 하지만 실제 업무에 붙여보면 점수가 높은 모델이 항상 답은 아니었다. 같은 작업을 몇 번씩 재시도해야 하거나, 결과를 사람이 다시 손봐야 하는 모델이라면 토큰 단가가 싸도 실제 비용은 더 클 수 있다. 아티피셜 애널리시스가 이 문제를 정면으로 겨냥한 플랫폼 Optima를 내놨다.
아티피셜 애널리시스는 GDPval-AA, AA-Briefcase 같은 벤치마크를 만들어온 독립 평가 회사다. 이번에 공개한 Optima는 범용 벤치마크가 아니라 사용자 자신의 데이터와 업무 흐름을 기준으로 모델을 겨루게 하는 도구다. 회사 설명에 따르면 사용자는 자신의 데이터, 워크플로, 또는 원하는 시나리오 설명을 넣어 벤치마크를 만들고 이를 현재 주요 모델들에 돌려 품질, 과제당 비용, 과제당 시간을 함께 비교할 수 있다.
데이터 없어도 시작할 수 있는 세 가지 길
Optima는 재료를 모으는 방식을 세 갈래로 열어뒀다. 이미 평가용 데이터셋을 가진 사용자는 자체 파일이나 허깅페이스에서 바로 불러올 수 있고, 에이전트를 운영 중인 팀은 Arize·Braintrust·Langfuse 같은 트레이스 도구에서 기록을 가져올 수 있다. 개발자라면 코딩 환경에 스킬을 설치해 과거 세션 정보를 자동으로 모으는 방식도 쓸 수 있다.
| 입력 경로 | 대상 | 방식 |
|---|---|---|
| 기존 평가 데이터셋 | 이미 데이터를 보유한 팀 | 자체 파일 또는 허깅페이스 업로드 |
| 에이전트 트레이스 | 에이전트 운영 중인 팀 | Arize·Braintrust·Langfuse 연동 |
| 코딩 세션 스킬 | 개발자 | 코딩 환경에 스킬 설치, 과거 세션 자동 수집 |
데이터가 아예 없어도 상관없다. 사용할 시나리오를 설명하고 예시 입력·출력 몇 개만 제공하면 Optima가 테스트 입력, 평가 기준, 예시 과제를 스스로 만들어 제안한다. 사용자는 이를 검토하고 피드백으로 다듬은 뒤 실제 벤치마크를 실행하면 된다.
채점은 두 갈래, 결과는 세 지표
채점 방식은 두 가지다. 하나는 객관적 기준에 맞춰 답을 평가하는 루브릭 방식이고, 다른 하나는 아티피셜 애널리시스가 GDPval-AA·AA-Briefcase에서도 쓰는 페어와이즈(쌍대 비교) 방식이다. 페어와이즈 방식에서는 사용자가 먼저 응답 쌍 일부를 보고 어느 쪽이 나은지 표시하면, Optima가 그 선호도를 바탕으로 전체 데이터셋에 대한 순위를 산출한다.
비교 결과는 품질 점수 하나로 끝나지 않는다. 과제당 비용과 과제당 시간이 독립된 비교 축으로 함께 제시된다. 에이전트형 애플리케이션에서는 토큰 단가만 봐서는 실제 비용을 가늠하기 어렵다. 값싼 모델이라도 시도 횟수가 늘거나 실패가 잦으면, 또는 결과물을 사람이 다시 손봐야 하면 총비용은 오히려 커진다. 완료된 과제 하나당 실제로 든 비용이 더 정직한 숫자인 셈이다.
실제로 확인된 활용 사례
아티피셜 애널리시스에 따르면 초기 테스터 중 일부는 재무·회계 에이전트용 벤치마크를 만들어, 품질을 크게 떨어뜨리지 않으면서 비용을 10분의 1로 줄일 수 있는 모델을 찾아냈다. 이는 Optima가 겨냥한 문제, 즉 범용 벤치마크로는 드러나지 않는 특정 업무 환경에서의 최적 모델 선택이 실제로 작동한다는 사례로 볼 수 있다.
어떻게 써보나
Optima는 현재 이용 가능한 상태로 공개됐다. 회사가 설명한 절차를 따라가면 다음과 같은 흐름으로 벤치마크를 만들 수 있다.
- 재료 고르기 — 이미 가진 평가 데이터셋을 파일이나 허깅페이스에서 불러오거나, 에이전트를 운영 중이면 Arize·Braintrust·Langfuse 트레이스를 연동한다. 코드를 짜는 팀이라면 코딩 환경에 스킬을 설치해 과거 세션 데이터를 자동으로 모을 수 있다.
- 데이터가 없으면 설명으로 시작 — 원하는 사용 시나리오를 글로 적고 예시 입력·출력을 몇 개 넣는다. Optima가 테스트 입력, 평가 기준, 예시 과제를 제안한다.
- 제안 다듬기 — 제안받은 테스트 구성을 검토하고 피드백을 반영해 원하는 형태로 조정한다.
- 채점 방식 선택 — 객관적 기준으로 채점하는 루브릭 방식과, 응답 쌍을 비교해 순위를 뽑는 페어와이즈 방식 중 고른다.
- 실행 및 비교 — 벤치마크를 현재 주요 모델들에 돌려 품질, 과제당 비용, 과제당 시간을 나란히 확인한다.
국가·요금제·플랫폼 제한 같은 구체적 이용 조건은 이번 발표에 명시되지 않았다. 다만 활용 범위 안에서는 몇 가지가 바로 떠오른다. 예를 들어 고객 상담 에이전트를 운영하는 팀이라면 실제 상담 로그를 트레이스로 넣어 어떤 모델이 응답 품질을 유지하면서 처리 시간을 줄이는지 확인할 수 있다. 코딩 팀이라면 스킬로 모은 과거 세션 데이터를 넣어 리팩터링이나 버그 수정 작업에서 어떤 모델이 실패율이 낮은지 비교할 수 있다.
지난 8월 10일 아티피셜 애널리시스는 공식 X 계정을 통해 개발자용 새 AI 벤치마킹 제품군을 준비 중이라며 얼리 액세스 신청을 받은 바 있다. 이번 Optima 출시가 그 제품군의 실체로 보인다.
에디터의 시선
AI 모델을 고르는 기준이 '지능지수 몇 점'에서 '내 업무에서 얼마나 싸고 빠르게 끝나는가'로 옮겨가는 흐름을 이번 출시가 잘 보여준다. 그록 4.6이 지능지수 61점으로 GPT-5.6 Sol과 동급에 올랐다는 소식이 나온 지 며칠 만에, 정작 순위를 매기던 회사 스스로가 '그 점수만으론 부족하다'고 인정한 셈이다. 실무형 벤치마크에서 그록 4.6이 클로드 오퍼스 5를 제외한 대부분 모델과 비슷하거나 앞서면서도 과제당 비용은 훨씬 낮았다는 사실은, 종합 점수와 실제 비용 효율이 따로 논다는 걸 이미 보여준 바 있다. Optima는 이 간극을 개인·기업 단위로 직접 재보라는 제안이다.
실무에서 모델을 붙여보면 늘 비슷한 패턴이 반복된다. 벤치마크 순위표에서 1위인 모델을 그대로 써보면 특정 업무에서는 오히려 답을 여러 번 고쳐야 하거나 형식을 못 맞춰 사람이 개입하는 일이 잦다. 반대로 순위가 낮은 모델이 특정 도메인에서는 실수 없이 한 번에 끝내는 경우도 흔하다. 종합 점수는 평균일 뿐, 내 업무가 그 평균에 속한다는 보장은 없다.
국내 기업이라면 이번 도구를 당장 전면 도입하기보다 특정 워크플로 하나에 시범 적용하는 편이 낫다. 예를 들어 고객 응대나 문서 요약처럼 실패 시 손실이 눈에 보이는 업무 하나를 골라 과제당 비용과 시간을 재보면, 지금 쓰는 모델이 정말 최선인지 숫자로 확인할 수 있다. 다만 벤치마크 설계 자체가 부실하면 결과도 부실하다는 점은 변하지 않는다. 페어와이즈 평가에서 처음 몇 개 응답 쌍을 어떻게 판단하느냐에 전체 순위가 좌우되는 만큼, 초기 판단 기준을 팀 내에서 미리 합의해두는 편이 안전하다.
앞으로 몇 주 안에 다른 평가 회사나 클라우드 업체들도 비슷한 '맞춤형 벤치마크' 도구를 내놓을 가능성이 크다. 벤치마크 시장 자체가 '누가 더 정확한 시험지를 만드느냐'에서 '누가 내 업무에 맞는 시험지를 대신 짜주느냐'로 옮겨가는 중이다.





댓글