
이미지: X — 벤치마크·평가 화면 갈무리
摘要
- xAI(标注为SpaceXAI)的Grok 4.6在Artificial Analysis Intelligence Index中获得61分,跻身与GPT-5.6 Sol同级的最高梯队
- 在GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项实务型基准测试中,除Claude Opus 5外,其表现与所有模型相当或更优
- 价格与上一代Grok 4.5保持一致,但单任务成本与Kimi K3相近,远低于Claude Opus 5和GPT-5.6 Sol
- 모델명
- Grok 4.6 (보도에서는 SpaceXAI 소속으로 표기)
- Intelligence Index 점수
- 61점, GPT-5.6 Sol과 동급
- 전작 대비
- Grok 4.5 대비 +5점, 출시 약 한 달 만
- GDPval-AA v2 Elo
- 1753 (Claude Opus 5 1849에 이어 2위)
- τ³-Banking 점수
- 50.7% (Qwen3.8 Max 51.3%에 이어 2위)
- Terminal-Bench v2.1
- 88.4% (Claude Opus 5 89.1%에 이어 2위)
- AA-Briefcase Elo
- 1577, Claude Opus 5에 이어 2위
- 가격
- Grok 4.5와 동일, 과제당 비용은 Kimi K3와 비슷한 수준
一个月提升5分,Grok的快速反弹
xAI推出的大型语言模型Grok 4.6在评测机构Artificial Analysis的Intelligence Index中获得61分。该测评帖中将该模型标注为"SpaceXAI's Grok 4.6"。61分与GPT-5.6 Sol处于同一水平,意味着该模型跻身最高梯队。值得注意的是速度:距上一代Grok 4.5发布仅一个多月,分数就提升了5分。

锁定Claude Opus 5之后的位置
Grok 4.6在知识型工作、终端操作、客户服务等实务型任务中表现突出。在Artificial Analysis自主测量的GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项基准测试中,除Claude Opus 5外,Grok 4.6与所有模型表现相当或更优。
| 模型 | GDPval-AA v2 (Elo) | τ³-Banking | Terminal-Bench v2.1 |
|---|---|---|---|
| Claude Opus 5 (max) | 1849 | 42.1% | 89.1% |
| Grok 4.6 (high) | 1753 | 50.7% | 88.4% |
| Claude Fable 5 | 1741 | 38.1% | 84.6% |
| Qwen3.8 Max | 1737 | 51.3% | 81.3% |
| GPT-5.6 Sol (max) | 1728 | 44.3% | 88.0% |
| Kimi K3 (max) | 1682 | 46.0% | 85.0% |
GDPval-AA v2是以人类基准(1000分)对实际业务任务进行评分的指标。τ³-Banking衡量银行业务场景处理能力,Terminal-Bench v2.1则测量计算机终端操作能力。在这三项指标中,Grok 4.6均稳居第二位。

便宜又好用——性价比表现
Grok 4.6的标准价格与Grok 4.5相比没有变化。尽管如此,智力指数却提升了5分。据Artificial Analysis称,其单任务成本与Kimi K3相近,远低于Claude Opus 5、GPT-5.6 Sol和Claude Fable 5。Artificial Analysis评价称,若将性能与成本同时标注在坐标系中,该模型正落在最优解(Pareto frontier)曲线上。
该模型也首次出现在专门测试长时间知识型工作任务的非公开基准AA-Briefcase中。在此项测试中获得的Elo为1577,同样位居Claude Opus 5之后第二。Artificial Analysis评价称:"在评分标准、文档组织、分析质量等方面均展现出持续稳定的强劲表现。"

Intelligence Index意味着什么
Intelligence Index是将多项基准测试分数综合为一体,用以对模型进行排序的指标。8月8日发布的Meta的Muse Spark 1.2在该指数中获得54分,曾与SpaceXAI并列第三。相比之下,蚂蚁集团8月12日发布的开放权重小型模型Ling 3.0 Tiny仅获得25分。从这一背景看,Grok 4.6的61分意味着其已进入大型闭源模型云集的最高梯队,而与开放权重小型模型之间的差距依然巨大。

这意味着什么变化
迄今为止,顶级智力与低廉成本一直被视为难以兼得的两个条件。Grok 4.6在价格不变的情况下提升了性能,将两者同时兼顾。对于需要反复运行长时间智能体任务的企业而言,即便未能达到Claude Opus 5级别的最高品质,也多了一个可以在不增加成本负担的前提下使用高水准性能的选项。这可以视为一个信号:前沿模型的竞争重心,正在从"谁最聪明"转向"谁能以同等成本完成更多任务"。



