METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

Artificial Analysis, 새 AI 벤치마킹 제품군 얼리 액세스 모집

모델 성능을 재던 독립 평가 기관이, 이번엔 개발자가 직접 쓰는 평가 도구를 준비 중이다

Artificial Analysis, 새 AI 벤치마킹 제품군 얼리 액세스 모집 · Image: METAL LAB

이미지: METAL

요약

  • Artificial Analysis가 개발자용 AI 벤치마킹 제품군을 개발 중이라고 공식 X 계정을 통해 밝혔다.
  • 출시 전 소수의 사용자 그룹을 모아 테스트와 피드백을 받는 얼리 액세스 신청을 함께 열었다.
  • 제품의 구체적 구성과 출시 시점은 이번 게시물에 담기지 않아, 현재는 모집 단계로 볼 수 있다.
발표 주체
Artificial Analysis
발표 채널
공식 X 계정 게시물
발표 시각
2026년 8월 10일 16시 11분(UTC)
개발 중인 것
개발자의 AI 모델 평가를 돕는 새 벤치마킹 제품군(a range of new AI benchmarking products)
모집 대상
출시 전 테스트와 피드백을 맡을 소수 사용자 그룹
참여 방법
게시물에 첨부된 얼리 액세스 신청 링크
현재 단계
출시 전(pre-launch), 정식 공개 시점은 게시물에 없음

재는 쪽이, 이번엔 자를 만들어 판다

새 모델이 나올 때마다 개발자들이 반사적으로 확인하는 것이 있다. 이 모델이 얼마나 똑똑한가, 초당 몇 토큰을 뱉는가, 첫 글자가 나오기까지 몇 초를 기다려야 하는가, 그리고 같은 일을 시켰을 때 어느 제공사가 더 싼가. 이런 숫자를 모델사 발표자료가 아니라 제3자 입장에서 재서 공개해온 곳이 Artificial Analysis다.

그 Artificial Analysis가 2026년 8월 10일 공식 X 계정에 짧은 글을 올렸다. 개발자가 AI 모델을 평가하는 데 쓸 새로운 벤치마킹 제품군을 만들고 있으며, 정식 출시 전에 소수의 사용자를 모아 직접 써보게 하고 피드백을 받겠다는 내용이다. 게시물에는 얼리 액세스 신청 링크가 함께 붙었다.

발표의 무게는 문장 길이에 있지 않다. 지금까지 이 회사가 해온 일이 "우리가 재서 보여주는 것"이었다면, 이번에는 "당신이 직접 재도록 도구를 주는 것"으로 방향이 한 칸 옮겨간다는 신호다.

Artificial Analysis는 어떤 곳인가

Artificial Analysis는 여러 모델과 추론 제공사를 같은 조건에서 비교해 공개해온 독립 벤치마킹 기관으로 알려져 있다. 모델의 능력을 종합한 지표, 초당 출력 토큰 수, 첫 토큰까지의 지연, 100만 토큰 단위 비용 같은 축을 나란히 놓는 방식이다. 같은 모델이라도 어느 호스팅 업체를 쓰느냐에 따라 속도와 가격이 갈린다는 사실을 숫자로 드러내온 것이 이 회사의 존재 이유였다.

평가 축실무에서 이게 결정하는 것
종합 지능 지표이 작업을 이 모델에 맡겨도 되는가
초당 출력 토큰긴 답변을 사용자가 얼마나 기다리는가
첫 토큰까지 지연채팅·음성에서 대화가 끊기는 느낌이 나는가
토큰 단가트래픽이 열 배 늘었을 때 감당되는가

표의 항목은 이 분야에서 통용되는 비교 축을 정리한 것으로, 이번 게시물이 어떤 축을 담는지는 별개다.

왜 지금 '평가 도구'인가

모델 발표가 주 단위로 쏟아지는 국면에서 벤치마크는 두 가지 병을 동시에 앓고 있다. 하나는 포화다. 여러 상위 모델이 같은 시험지에서 90점대를 찍기 시작하면 그 시험지는 더 이상 차이를 못 가른다. 다른 하나는 오염이다. 공개된 문제와 정답이 학습 데이터에 섞여 들어가면 점수는 실력이 아니라 기억력을 재게 된다.

여기에 평가 대상 자체가 어려워졌다. 답 하나를 채점하던 시절과 달리, 지금은 도구를 여러 번 호출하고 브라우저를 돌리며 수십 단계를 밟는 에이전트를 평가해야 한다. 중간에 한 번 잘못 눌러도 최종 답은 맞을 수 있고, 답은 맞아도 과정에서 위험한 행동을 했을 수 있다. 그래서 각 팀이 자기 업무에 맞춰 직접 재는 '사내 평가'가 필수 작업이 됐고, 그 작업을 대신 떠받쳐줄 도구 수요가 생겼다.

평가를 세분화하려는 시도는 이 회사만의 것이 아니다. 지난 8월 7일 Ai2는 AI 튜터가 학생을 도울 때와 스스로 생각하도록 물러날 때를 구분하는 판단력을 재는 프레임워크 TutorMoments의 프리뷰를 공개한 바 있다. 정답률 대신 '언제 개입하느냐'를 측정 대상으로 삼은 사례다.

얼리 액세스라는 형식이 말해주는 것

소수를 먼저 받아 피드백을 듣겠다는 방식은, 제품이 아직 굳지 않았다는 뜻이기도 하다. 벤치마킹 도구는 특히 그렇다. 어떤 작업을 표준 과제로 삼을지, 채점을 사람이 할지 다른 모델이 할지, 같은 조건을 어떻게 재현할지 — 설계 하나하나가 결과 숫자를 통째로 바꾼다. 신청자 규모와 선정 기준은 이번 게시물에 담기지 않았다.

그래서 무엇이 달라지나

모델을 고르는 일은 이제 '가장 좋은 모델'을 찾는 문제가 아니다. 내 작업, 내 예산, 내가 견딜 수 있는 응답 지연에서 가장 덜 아쉬운 조합을 찾는 문제다. 순위표 한 장으로는 그 답이 안 나온다. 남이 만든 시험지의 점수를 읽는 단계에서, 내 데이터로 내 시험지를 만들어 돌리는 단계로 넘어가야 한다는 뜻이다.

독립 평가 기관이 그 도구를 직접 들고 나오면, 그동안 평가 파이프라인을 처음부터 짜야 했던 작은 팀들의 진입 문턱이 낮아질 여지가 생긴다. 동시에 새로운 긴장도 생긴다. 순위표를 매기는 곳이 평가 도구까지 공급하면, 그 도구의 기본 설정이 사실상 업계 표준 시험지가 된다. 지금 확인된 것은 그 도구가 만들어지고 있고, 먼저 써볼 사람을 찾는다는 사실까지다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글