每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Grok 4.6智力指数61分 升至与GPT-5.6同级 价格保持不变

发布仅一个月提升5分,在智能体任务中锁定Claude Opus 5之后的第二席位

AI 모델별 지능 지수를 비교한 막대 그래프

이미지: X — 벤치마크·평가 화면 갈무리

摘要

  • xAI(标注为SpaceXAI)的Grok 4.6在Artificial Analysis Intelligence Index中获得61分,跻身与GPT-5.6 Sol同级的最高梯队
  • 在GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项实务型基准测试中,除Claude Opus 5外,其表现与所有模型相当或更优
  • 价格与上一代Grok 4.5保持一致,但单任务成本与Kimi K3相近,远低于Claude Opus 5和GPT-5.6 Sol
모델명
Grok 4.6 (보도에서는 SpaceXAI 소속으로 표기)
Intelligence Index 점수
61점, GPT-5.6 Sol과 동급
전작 대비
Grok 4.5 대비 +5점, 출시 약 한 달 만
GDPval-AA v2 Elo
1753 (Claude Opus 5 1849에 이어 2위)
τ³-Banking 점수
50.7% (Qwen3.8 Max 51.3%에 이어 2위)
Terminal-Bench v2.1
88.4% (Claude Opus 5 89.1%에 이어 2위)
AA-Briefcase Elo
1577, Claude Opus 5에 이어 2위
가격
Grok 4.5와 동일, 과제당 비용은 Kimi K3와 비슷한 수준

一个月提升5分,Grok的快速反弹

xAI推出的大型语言模型Grok 4.6在评测机构Artificial Analysis的Intelligence Index中获得61分。该测评帖中将该模型标注为"SpaceXAI's Grok 4.6"。61分与GPT-5.6 Sol处于同一水平,意味着该模型跻身最高梯队。值得注意的是速度:距上一代Grok 4.5发布仅一个多月,分数就提升了5分。

이미지: X — 벤치마크·평가

锁定Claude Opus 5之后的位置

Grok 4.6在知识型工作、终端操作、客户服务等实务型任务中表现突出。在Artificial Analysis自主测量的GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项基准测试中,除Claude Opus 5外,Grok 4.6与所有模型表现相当或更优。

模型GDPval-AA v2 (Elo)τ³-BankingTerminal-Bench v2.1
Claude Opus 5 (max)184942.1%89.1%
Grok 4.6 (high)175350.7%88.4%
Claude Fable 5174138.1%84.6%
Qwen3.8 Max173751.3%81.3%
GPT-5.6 Sol (max)172844.3%88.0%
Kimi K3 (max)168246.0%85.0%

GDPval-AA v2是以人类基准(1000分)对实际业务任务进行评分的指标。τ³-Banking衡量银行业务场景处理能力,Terminal-Bench v2.1则测量计算机终端操作能力。在这三项指标中,Grok 4.6均稳居第二位。

이미지: X — 벤치마크·평가

便宜又好用——性价比表现

Grok 4.6的标准价格与Grok 4.5相比没有变化。尽管如此,智力指数却提升了5分。据Artificial Analysis称,其单任务成本与Kimi K3相近,远低于Claude Opus 5、GPT-5.6 Sol和Claude Fable 5。Artificial Analysis评价称,若将性能与成本同时标注在坐标系中,该模型正落在最优解(Pareto frontier)曲线上。

该模型也首次出现在专门测试长时间知识型工作任务的非公开基准AA-Briefcase中。在此项测试中获得的Elo为1577,同样位居Claude Opus 5之后第二。Artificial Analysis评价称:"在评分标准、文档组织、分析质量等方面均展现出持续稳定的强劲表现。"

이미지: X — 벤치마크·평가

Intelligence Index意味着什么

Intelligence Index是将多项基准测试分数综合为一体,用以对模型进行排序的指标。8月8日发布的Meta的Muse Spark 1.2在该指数中获得54分,曾与SpaceXAI并列第三。相比之下,蚂蚁集团8月12日发布的开放权重小型模型Ling 3.0 Tiny仅获得25分。从这一背景看,Grok 4.6的61分意味着其已进入大型闭源模型云集的最高梯队,而与开放权重小型模型之间的差距依然巨大。

이미지: X — 벤치마크·평가

这意味着什么变化

迄今为止,顶级智力与低廉成本一直被视为难以兼得的两个条件。Grok 4.6在价格不变的情况下提升了性能,将两者同时兼顾。对于需要反复运行长时间智能体任务的企业而言,即便未能达到Claude Opus 5级别的最高品质,也多了一个可以在不增加成本负担的前提下使用高水准性能的选项。这可以视为一个信号:前沿模型的竞争重心,正在从"谁最聪明"转向"谁能以同等成本完成更多任务"。