METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Grok 4.6智能指数61分 与GPT-5.6同级 价格不变

发布仅一个月提升5分,在智能体任务中预定Claude Opus 5之后的第二位置

Grok 4.6智能指数61分 与GPT-5.6同级 价格不变

摘要

  • xAI(标注为SpaceXAI)的Grok 4.6在Artificial Analysis Intelligence Index中获得61分,跻身与GPT-5.6 Sol同级的最高梯队
  • 在GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项实务型基准测试中,除Claude Opus 5外与所有模型持平或领先
  • 价格与前代Grok 4.5相同,但单任务成本处于Kimi K3水平,远低于Claude Opus 5和GPT-5.6 Sol

一个月涨5分,Grok的快速反弹

xAI推出的大型语言模型Grok 4.6在评测机构Artificial Analysis的Intelligence Index中获得61分。该测评帖中将此模型标注为"SpaceXAI's Grok 4.6"。61分与GPT-5.6 Sol处于同一水平,意味着该模型跻身最高梯队之列。值得关注的是速度——距离前代Grok 4.5发布仅一个多月,分数就跳升了5分。

여러 AI 모델의 성능 점수를 비교한 세 개의 가로 막대그래프 차트
이미지: @ArtificialAnlys (X)

预定了Claude Opus 5之后的第二位置

Grok 4.6在知识工作、终端操作、客户服务等实务型任务上表现突出。在Artificial Analysis独立测量的GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1三项基准测试中,Grok 4.6除Claude Opus 5外,与所有模型持平或领先。

模型GDPval-AA v2 (Elo)τ³-BankingTerminal-Bench v2.1
Claude Opus 5 (max)184942.1%89.1%
Grok 4.6 (high)175350.7%88.4%
Claude Fable 5174138.1%84.6%
Qwen3.8 Max173751.3%81.3%
GPT-5.6 Sol (max)172844.3%88.0%
Kimi K3 (max)168246.0%85.0%

GDPval-AA v2是以人类基准(1000分)为标准对实际工作进行评分的指标。τ³-Banking测量银行业务场景处理能力,Terminal-Bench v2.1测量计算机终端操作能力。在这三项指标中,Grok 4.6均守住了第二的位置。

인공지능 지능지수와 작업당 비용을 비교한 산점도 그래프
이미지: @ArtificialAnlys (X)

便宜又好用——性价比表现

Grok 4.6的标准定价与Grok 4.5相比没有变化,但智能指数却提升了5分。根据Artificial Analysis的数据,其单任务成本与Kimi K3相近,远低于Claude Opus 5、GPT-5.6 Sol、Claude Fable 5。Artificial Analysis评价称,若将性能与成本同时置于坐标系中,该模型正处于最优边界(Pareto frontier)之上。

该模型还首次出现在处理长时间知识工作任务的非公开基准AA-Briefcase中。在此项测试中获得的Elo为1577,同样仅次于Claude Opus 5。Artificial Analysis评价称:"在评分标准、文档组织、分析质量等各方面均展现出持续的强劲表现。"

AA-Briefcase Elo 점수를 비교한 가로 막대그래프 차트
이미지: @ArtificialAnlys (X)

Intelligence Index意味着什么

Intelligence Index是将多项基准测试分数综合为一体、对模型进行排名的指标。今年8月8日发布的Meta的Muse Spark 1.2曾在该指数中获得54分,与SpaceXAI并列第三。相比之下,8月12日发布的蚂蚁集团开放权重小型模型Ling 3.0 Tiny仅获得25分。从这个角度看,Grok 4.6的61分意味着它进入了大型闭源模型云集的最高梯队,而与开放权重小型模型之间的差距依然巨大。

다양한 AI 평가 항목별 점수를 비교한 여러 가로 막대그래프 차트
이미지: @ArtificialAnlys (X)

这意味着什么变化

迄今为止,顶尖智能与低廉成本一直被视为难以兼得的条件。Grok 4.6在保持价格不变的同时提升了性能,将两者同时收入囊中。对于需要反复运行长时间智能体任务的企业而言,即便达不到Claude Opus 5那样的最高品质,也多了一个无需承担高昂成本、就能使用上游性能的选项。这可被视为一个信号:前沿模型竞争的重心正从"谁更聪明"转向"谁能以相同成本完成更多任务"。

评论