每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Grok 4.6发布…顶级性能、价格减半

智能指数61分,与GPT-5.6 Sol打平,与Claude Opus 5的差距缩小到2分,但价格却不到对手的一半。没有扩大模型规模,仅靠训练方法的改变就实现了跨越,xAI引发的价格战才刚刚开始。

이미지: AI 생성 — METAL LAB

摘要

  • xAI于12日发布了Grok 4.6。Artificial Analysis智能指数达到61分,与GPT-5.6 Sol同级,仅次于Claude Opus 5、Claude Fable 5,跻身最顶尖行列。
  • 其单价为每百万token输入2美元、输出6美元,不到同级模型的一半,处理代理任务时所用轮次仅为Opus 5的一半、token消耗仅为四分之一。
  • 该模型在保持基础模型不变的情况下,仅强化了后训练环节,而基础模型更大的Grok 4.7预计将在数周内发布,预计价格与性能竞争将进一步加剧。

预告8天后如约而至的更新

xAI于当地时间12日发布了Grok 4.6。发布的同时立即开放了API、编程工具Cursor及自研平台Grok Build的接入,还可通过OpenRouter、Vercel、Cloudflare等合作渠道即时使用。首周还在Grok Build和Cursor上推出了使用额度翻倍的促销活动。

这正是埃隆·马斯克本月初预告"下周左右推出"的那款模型。对于路线图时间表以延误著称的xAI来说,这次的准时交付实属罕见。

指数61分——跻身最顶尖行列

独立评测机构Artificial Analysis(AA)给Grok 4.6打出了61分的智能指数。这与OpenAI的GPT-5.6 Sol打平,仅次于Anthropic的Claude Opus 5(63分)和Claude Fable 5(62分)。可以说已经在实质上与前沿最顶尖阵营并肩而立。

涨幅尤为陡峭。相比Grok 4.5提升了5分,相比4.3提升了23分,此次还超越了此前被视为性价比强者的Kimi K3。问题在于这份成绩单所附带的价格。

模型AA智能指数单价(每百万token,输入/输出)
Claude Opus 5635 / 25美元
Claude Fable 562
Grok 4.6612 / 6美元
GPT-5.6 Sol615 / 30美元
Kimi K361之前

价格减半的算法

Grok 4.6的单价为每百万token输入2美元、输出6美元,相较4.5一分未涨。与同分段的GPT-5.6 Sol或Opus 5相比,便宜60%以上。就好比是一位一直以来拿着同样成绩单的家教老师,但学费却只有一半。

前沿模型输出单价对比图表
图表:METAL LAB

当然也有悄悄上涨的项目。缓存命中费用从每百万token 0.3美元涨到了0.5美元。AA运行完整基准测试后得出的每任务成本为0.84美元——与Kimi K3的成本相同,却获得了更高的智能水平。

派它去做代理工作时更让人惊讶

这次版本真正的卖点在于代理任务处理能力。在实务型知识劳动基准测试GDPval-AA v2中,其Elo评分为1753,仅次于Opus 5位列第二;在终端任务基准测试Terminal-Bench v2.1中取得了88.4%的成绩。银行业务模拟测试τ³-Banking得分50.7%,位居顶尖行列;在知识劳动综合评测AA-Briefcase中,Elo评分为1577,也与最顶尖模型处于同一梯队。

用一半的往返次数完成工作的效率概念图
图片:AI生成——METAL LAB

其做事方式尤为不同。在长时间代理任务中,Grok 4.6平均耗时53轮、输入token为5亿个即可得出结果。而Opus 5要产出类似的结果,则需约103轮、耗费20亿token。这相当于一名员工用一半的往返次数和四分之一的话语量就完成了同样的差事,因此在实际账单上,两者的单价差距会被进一步拉大。

模型规模不变,只是换了训练方法

据外媒分析,Grok 4.6是在保留4.5基础模型的前提下,仅替换了以SFT(监督微调)和强化学习为核心的后训练环节而得到的版本。上下文窗口也同样维持在50万token不变。也就是说,并非重新搭建架构,而是只改变了"烹饪配方",便提升了5分。

下一步动向也已被预告。据传基础模型更大的Grok 4.7将在数周内推出,马斯克更是放话称将超越现存所有模型。不过考虑到xAI以往在时间表上多次延误的记录,这次能否像本次一样按期兑现,将是外界关注的焦点。

编辑视角

在此次发布中,最令人驻足良久的数字并非61分,而是53轮。通过API接入多个前沿模型运行代理任务时会发现,真正决定成本的并非价目表,而是模型完成任务所需的轮次。即便单价相同,如果一个模型完成同样任务需要两倍的轮次,账单也会翻倍。Grok 4.6在把单价压到一半的同时,还减少了往返次数,因此实际体感差距很可能会比基准测试表格所显示的更大。

仅靠后训练就提升了5分这一点也值得细细品味。直到去年为止,提升分数的常规做法还是扩大模型规模,但今年各家前沿实验室已经一致转向:在相同规模下,靠训练方法制造差距。这意味着基础体能已经普遍拉齐,胜负将取决于调教技巧。

对于国内团队而言,与其把这次发布解读为"该换模型了",不如将其视为一张"谈判筹码"。在前沿级智能的单价在半年内如此大幅下跌的环境中,一旦把整条流水线钉死在某一特定模型上,损失便随之开始累积。像适配层、自建评测集、提示词可迁移性这类能够降低模型更换成本的投入,才是当下回报率最高的投资。事实上,就在当晚,DeepSeek便在几个小时内以更低的价目表作出回应,可见这场价格战才刚刚拉开序幕。