
이미지: X — 벤치마크·평가 화면 갈무리
요약
- xAI(SpaceXAI로 표기)의 Grok 4.6이 Artificial Analysis Intelligence Index에서 61점을 받아 GPT-5.6 Sol과 같은 최상위권에 올랐다
- GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 세 실무형 벤치마크에서 Claude Opus 5를 제외한 모든 모델과 비슷하거나 앞섰다
- 가격은 전작 Grok 4.5와 동일한데 과제당 비용은 Kimi K3 수준으로, 클로드 오�스5·GPT-5.6 Sol보다 훨씨 낮다
- 모델명
- Grok 4.6 (보도에서는 SpaceXAI 소속으로 표기)
- Intelligence Index 점수
- 61점, GPT-5.6 Sol과 동급
- 전작 대비
- Grok 4.5 대비 +5점, 출시 약 한 달 만
- GDPval-AA v2 Elo
- 1753 (Claude Opus 5 1849에 이어 2위)
- τ³-Banking 점수
- 50.7% (Qwen3.8 Max 51.3%에 이어 2위)
- Terminal-Bench v2.1
- 88.4% (Claude Opus 5 89.1%에 이어 2위)
- AA-Briefcase Elo
- 1577, Claude Opus 5에 이어 2위
- 가격
- Grok 4.5와 동일, 과제당 비용은 Kimi K3와 비슷한 수준
한 달 만에 5점, 그록의 빠른 재도약
xAI가 내놓은 대형언어모델 Grok 4.6이 평가기관 Artificial Analysis의 Intelligence Index에서 61점을 받았다. 해당 게시물에서는 이 모델을 'SpaceXAI's Grok 4.6'으로 표기했다. 61점은 GPT-5.6 Sol과 같은 수준으로, 최상위권 모델 대열에 합류했다는 뜻이다. 눈에 띄는 건 속도다. 전작 Grok 4.5가 나온 지 한 달여 만에 점수가 5점 뛰었다.

클로드 오�스5 다음 자리를 예약했다
Grok 4.6은 지식노동, 터미널 조작, 고객서비스 같은 실무형 과제에서 강세를 보였다. Artificial Analysis가 독자적으로 측정한 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1 세 벤치마크에서 Grok 4.6은 Claude Opus 5를 제외한 모든 모델과 비슷하거나 앞섰다.
| 모델 | GDPval-AA v2 (Elo) | τ³-Banking | Terminal-Bench v2.1 |
|---|---|---|---|
| Claude Opus 5 (max) | 1849 | 42.1% | 89.1% |
| Grok 4.6 (high) | 1753 | 50.7% | 88.4% |
| Claude Fable 5 | 1741 | 38.1% | 84.6% |
| Qwen3.8 Max | 1737 | 51.3% | 81.3% |
| GPT-5.6 Sol (max) | 1728 | 44.3% | 88.0% |
| Kimi K3 (max) | 1682 | 46.0% | 85.0% |
GDPval-AA v2는 실제 업무를 사람 기준(1000점)에 맞춰 채점하는 지표다. τ³-Banking은 은행 업무 시나리오, Terminal-Bench v2.1은 컴퓨터 터미널 조작 능력을 측정한다. 세 지표 모두에서 Grok 4.6은 2위 자리를 지켰다.

값싸게 잘한다 — 비용 대비 성능
Grok 4.6의 표준 가격은 Grok 4.5와 달라지지 않았다. 그런데도 지능 지수는 5점 올랐다. Artificial Analysis에 따르면 과제당 비용은 Kimi K3와 비슷한 수준이고, Claude Opus 5, GPT-5.6 Sol, Claude Fable 5보다는 훨씬 낮다. 성능과 비용을 동시에 좌표에 놓았을 때 최적선(Pareto frontier)에 걸리는 모델이라는 게 Artificial Analysis의 평가다.
모델은 장시간 지식노동 과제를 다루는 비공개 벤치마크 AA-Briefcase에도 처음 등장했다. 여기서 받은 Elo는 1577로 역시 Claude Opus 5 다음이었다. Artificial Analysis는 "채점 기준, 문서 구성, 분석 품질 전반에서 꾸준히 강한 성능을 보였다"고 평가했다.

Intelligence Index가 뭘 의미하나
Intelligence Index는 여러 벤치마크 점수를 하나로 종합해 모델 간 서열을 매기는 지표다. 지난 8월 8일 공개된 메타(Meta)의 Muse Spark 1.2는 이 지수에서 54점을 받아 SpaceXAI와 공동 3위에 오른 적이 있다. 반면 8월 12일 공개된 앤트그룹의 오픈웨이트 소형 모델 Ling 3.0 Tiny는 25점에 머물렀다. 이 맥락에서 보면 Grok 4.6의 61점은 대형 폐쇄형 모델들이 밀집한 최상위 구간에 진입했다는 뜻이고, 오픈웨이트 소형 모델과의 격차는 여전히 크다.

그래서 무엇이 달라지나
지금까지 최상위 지능과 저렴한 비용은 양립하기 어려운 조건으로 여겨졌다. Grok 4.6은 가격을 그대로 두고 성능만 올려 이 둘을 함께 가져갔다. 장시간 에이전트 작업을 반복적으로 돌려야 하는 기업 입장에서는 클로드 오�스5 수준의 최고 품질까지는 아니어도, 비용 부담 없이 상위권 성능을 쓸 수 있는 선택지가 하나 늘어난 셈이다. 프런티어 모델 경쟁의 축이 '누가 가장 똑똑한가'에서 '누가 같은 비용으로 더 많이 해내는가'로 옮겨가고 있다는 신호로 볼 수 있다.



