매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

그록 4.6, 지능지수 61점...GPT-5.6과 동급 오르며 가격은 그대로

출시 한 달 만에 5점 상승, 에이전틱 작업에서 클로드 오�스5 다음 자리 예약

AI 모델별 지능 지수를 비교한 막대 그래프

이미지: X — 벤치마크·평가 화면 갈무리

요약

  • xAI(SpaceXAI로 표기)의 Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받아 GPT-5.6 Sol과 같은 최상위권에 올랐다
  • GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 세 실무형 벤치마크에서 Claude Opus 5를 제외한 모든 모델과 비슷하거나 앞섰다
  • 가격은 전작 Grok 4.5와 동일한데 과제당 비용은 Kimi K3 수준으로, 클로드 오�스5·GPT-5.6 Sol보다 훨씨 낮다
모델명
Grok 4.6 (보도에서는 SpaceXAI 소속으로 표기)
Intelligence Index 점수
61점, GPT-5.6 Sol과 동급
전작 대비
Grok 4.5 대비 +5점, 출시 약 한 달 만
GDPval-AA v2 Elo
1753 (Claude Opus 5 1849에 이어 2위)
τ³-Banking 점수
50.7% (Qwen3.8 Max 51.3%에 이어 2위)
Terminal-Bench v2.1
88.4% (Claude Opus 5 89.1%에 이어 2위)
AA-Briefcase Elo
1577, Claude Opus 5에 이어 2위
가격
Grok 4.5와 동일, 과제당 비용은 Kimi K3와 비슷한 수준

한 달 만에 5점, 그록의 빠른 재도약

xAI가 내놓은 대형언어모델 Grok 4.6이 평가기관 Artificial Analysis의 Intelligence Index에서 61점을 받았다. 해당 게시물에서는 이 모델을 'SpaceXAI's Grok 4.6'으로 표기했다. 61점은 GPT-5.6 Sol과 같은 수준으로, 최상위권 모델 대열에 합류했다는 뜻이다. 눈에 띄는 건 속도다. 전작 Grok 4.5가 나온 지 한 달여 만에 점수가 5점 뛰었다.

이미지: X — 벤치마크·평가

클로드 오�스5 다음 자리를 예약했다

Grok 4.6은 지식노동, 터미널 조작, 고객서비스 같은 실무형 과제에서 강세를 보였다. Artificial Analysis가 독자적으로 측정한 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 세 벤치마크에서 Grok 4.6은 Claude Opus 5를 제외한 모든 모델과 비슷하거나 앞섰다.

모델GDPval-AA v2 (Elo)τ³-BankingTerminal-Bench v2.1
Claude Opus 5 (max)184942.1%89.1%
Grok 4.6 (high)175350.7%88.4%
Claude Fable 5174138.1%84.6%
Qwen3.8 Max173751.3%81.3%
GPT-5.6 Sol (max)172844.3%88.0%
Kimi K3 (max)168246.0%85.0%

GDPval-AA v2는 실제 업무를 사람 기준(1000점)에 맞춰 채점하는 지표다. τ³-Banking은 은행 업무 시나리오, Terminal-Bench v2.1은 컴퓨터 터미널 조작 능력을 측정한다. 세 지표 모두에서 Grok 4.6은 2위 자리를 지켰다.

이미지: X — 벤치마크·평가

값싸게 잘한다 — 비용 대비 성능

Grok 4.6의 표준 가격은 Grok 4.5와 달라지지 않았다. 그런데도 지능 지수는 5점 올랐다. Artificial Analysis에 따르면 과제당 비용은 Kimi K3와 비슷한 수준이고, Claude Opus 5, GPT-5.6 Sol, Claude Fable 5보다는 훨씬 낮다. 성능과 비용을 동시에 좌표에 놓았을 때 최적선(Pareto frontier)에 걸리는 모델이라는 게 Artificial Analysis의 평가다.

모델은 장시간 지식노동 과제를 다루는 비공개 벤치마크 AA-Briefcase에도 처음 등장했다. 여기서 받은 Elo는 1577로 역시 Claude Opus 5 다음이었다. Artificial Analysis는 "채점 기준, 문서 구성, 분석 품질 전반에서 꾸준히 강한 성능을 보였다"고 평가했다.

이미지: X — 벤치마크·평가

Intelligence Index가 뭘 의미하나

Intelligence Index는 여러 벤치마크 점수를 하나로 종합해 모델 간 서열을 매기는 지표다. 지난 8월 8일 공개된 메타(Meta)의 Muse Spark 1.2는 이 지수에서 54점을 받아 SpaceXAI와 공동 3위에 오른 적이 있다. 반면 8월 12일 공개된 앤트그룹의 오픈웨이트 소형 모델 Ling 3.0 Tiny는 25점에 머물렀다. 이 맥락에서 보면 Grok 4.6의 61점은 대형 폐쇄형 모델들이 밀집한 최상위 구간에 진입했다는 뜻이고, 오픈웨이트 소형 모델과의 격차는 여전히 크다.

이미지: X — 벤치마크·평가

그래서 무엇이 달라지나

지금까지 최상위 지능과 저렴한 비용은 양립하기 어려운 조건으로 여겨졌다. Grok 4.6은 가격을 그대로 두고 성능만 올려 이 둘을 함께 가져갔다. 장시간 에이전트 작업을 반복적으로 돌려야 하는 기업 입장에서는 클로드 오�스5 수준의 최고 품질까지는 아니어도, 비용 부담 없이 상위권 성능을 쓸 수 있는 선택지가 하나 늘어난 셈이다. 프런티어 모델 경쟁의 축이 '누가 가장 똑똑한가'에서 '누가 같은 비용으로 더 많이 해내는가'로 옮겨가고 있다는 신호로 볼 수 있다.