
摘要
- xAI(标注为SpaceXAI)的Grok 4.6在Artificial Analysis Intelligence Index中获得61分,跻身与GPT-5.6 Sol同级的最高梯队
- 在GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项实务型基准测试中,除Claude Opus 5外与所有模型持平或领先
- 价格与前代Grok 4.5相同,但单任务成本处于Kimi K3水平,远低于Claude Opus 5和GPT-5.6 Sol
一个月涨5分,Grok的快速反弹
xAI推出的大型语言模型Grok 4.6在评测机构Artificial Analysis的Intelligence Index中获得61分。该测评帖中将此模型标注为"SpaceXAI's Grok 4.6"。61分与GPT-5.6 Sol处于同一水平,意味着该模型跻身最高梯队之列。值得关注的是速度——距离前代Grok 4.5发布仅一个多月,分数就跳升了5分。

预定了Claude Opus 5之后的第二位置
Grok 4.6在知识工作、终端操作、客户服务等实务型任务上表现突出。在Artificial Analysis独立测量的GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项基准测试中,Grok 4.6除Claude Opus 5外,与所有模型持平或领先。
| 模型 | GDPval-AA v2 (Elo) | τ³-Banking | Terminal-Bench v2.1 |
|---|---|---|---|
| Claude Opus 5 (max) | 1849 | 42.1% | 89.1% |
| Grok 4.6 (high) | 1753 | 50.7% | 88.4% |
| Claude Fable 5 | 1741 | 38.1% | 84.6% |
| Qwen3.8 Max | 1737 | 51.3% | 81.3% |
| GPT-5.6 Sol (max) | 1728 | 44.3% | 88.0% |
| Kimi K3 (max) | 1682 | 46.0% | 85.0% |
GDPval-AA v2是以人类基准(1000分)为标准对实际工作进行评分的指标。τ³-Banking测量银行业务场景处理能力,Terminal-Bench v2.1测量计算机终端操作能力。在这三项指标中,Grok 4.6均守住了第二的位置。

便宜又好用——性价比表现
Grok 4.6的标准定价与Grok 4.5相比没有变化,但智能指数却提升了5分。根据Artificial Analysis的数据,其单任务成本与Kimi K3相近,远低于Claude Opus 5、GPT-5.6 Sol、Claude Fable 5。Artificial Analysis评价称,若将性能与成本同时置于坐标系中,该模型正处于最优边界(Pareto frontier)之上。
该模型还首次出现在处理长时间知识工作任务的非公开基准AA-Briefcase中。在此项测试中获得的Elo为1577,同样仅次于Claude Opus 5。Artificial Analysis评价称:"在评分标准、文档组织、分析质量等各方面均展现出持续的强劲表现。"

Intelligence Index意味着什么
Intelligence Index是将多项基准测试分数综合为一体、对模型进行排名的指标。今年8月8日发布的Meta的Muse Spark 1.2曾在该指数中获得54分,与SpaceXAI并列第三。相比之下,8月12日发布的蚂蚁集团开放权重小型模型Ling 3.0 Tiny仅获得25分。从这个角度看,Grok 4.6的61分意味着它进入了大型闭源模型云集的最高梯队,而与开放权重小型模型之间的差距依然巨大。

这意味着什么变化
迄今为止,顶尖智能与低廉成本一直被视为难以兼得的条件。Grok 4.6在保持价格不变的同时提升了性能,将两者同时收入囊中。对于需要反复运行长时间智能体任务的企业而言,即便达不到Claude Opus 5那样的最高品质,也多了一个无需承担高昂成本、就能使用上游性能的选项。这可被视为一个信号:前沿模型竞争的重心正从"谁更聪明"转向"谁能以相同成本完成更多任务"。





评论