METAL LAB

Meta Muse Spark 1.3编码基准超越GPT-5.6、Opus 5

长上下文与编码得分领先,但整体知识型工作表现仍不及Opus 5

摘要

  • Meta于9月2日发布Muse Spark 1.3,称其强化了智能体式(agentic)任务与编码性能,并提升了实际使用体验。
  • 在同步公布的基准测试中,Muse Spark 1.3在DeepSWE、SWEAtlas等编码指标以及长上下文(MRCR)指标上超越了GPT-5.6 Sol和Opus 5。
  • 不过在衡量整体办公室知识型工作能力的GDPVal-AA v2和JobBench测试中,Opus 5仍保持最高得分。

Meta时隔一个月再推Muse Spark新版本

Meta于当地时间9月2日通过AI at Meta官方X账号公开了大语言模型Muse Spark 1.3。Meta表示,此次模型在智能体式(能自主处理多个步骤的)任务和编码性能方面有所改进,并将重点放在了实际工作环境中的可用性上。在发布文章中,Meta介绍称,这款模型能够在单一对话窗口内处理跨多个工作流程、持续时间更长的任务,并在需要时主动向用户提问,以更积极的方式与用户协作。

图中有三个图形。左侧是由逐渐变大的点(asc_dots)绘制的Muse Spark 1.3,右上方是以简单圆形(ring)绘制的GPT-5.6 Sol,右下方是以粗环(heavy_ring)绘制的Opus 5。从Muse Spark指向GPT-5.6的是一条实线箭头,标注为"领先";Muse Spark与Opus 5之间则是一条虚线双向箭头,标注为"互有胜负"——表示在编码和长上下文方面领先,但在整体知识型工作上Opus 5仍占上风。图中有三个图形。左侧是由逐渐变大的点(asc_dots)绘制的Muse Spark 1.3,右上方是以简单圆形(ring)绘制的GPT-5.6 Sol,右下方是以粗环(heavy_ring)绘制的Opus 5。从Muse Spark指向GPT-5.6的是一条实线箭头,标注为"领先";Muse Spark与Opus 5之间则是一条虚线双向箭头,标注为"互有胜负"——表示在编码和长上下文方面领先,但在整体知识型工作上Opus 5仍占上风。

简单来说,GPT-5.6 Sol是OpenAI推出的最新旗舰模型,Opus 5则是Anthropic的旗舰模型。Meta此次将这两款模型并列纳入基准测试表,意味着三家公司正围绕智能体与编码性能,以同一套标准展开较量。

编码与长上下文领先GPT-5.6、Opus 5

从Meta同步公布的基准测试表来看,Muse Spark 1.3在衡量编码与长上下文处理能力的指标上领先于竞争对手。在衡量大规模代码库层面长期软件任务的DeepSWE v1.1测试中,该模型获得75.4分,超过了GPT-5.6 Sol(73.0分)和Opus 5(74.0分);在衡量代码库理解能力的SWEAtlas CodeBase QnA测试中,其得分为59.4分,同样超过另外两款模型(分别为53.5分和52.7分)。在衡量长文档处理能力的MRCR指标上,差距更为明显:在51.2万至100万token区间,Muse Spark 1.3取得98.1分,大幅领先GPT-5.6 Sol的73.8分,而Opus 5在该区间的得分本身未被公开。

이미지: @AIatMeta (X)

整体知识型工作仍是Opus 5领先

相比之下,在衡量整体办公室知识型工作能力的GDPVal-AA v2测试中,Opus 5以1824分位居第一,Muse Spark 1.3以1754分紧随其后。在衡量实际使用多种工作工具能力的JobBench(Opus 5为65.7分,Muse Spark 1.3为64.9分)、直接操作电脑屏幕的OSWorld 2.0(Opus 5为68.3分,Muse Spark 1.3为66.9分),以及处理完整工作流程的AutomationBench(Opus 5为50.3分,Muse Spark 1.3为49.4分)测试中,Opus 5也均以微弱优势领先。而在衡量指令遵循准确度的内部指标(Agentic IF Index)以及自主网络搜索能力的DeepSearchQA测试中,则是GPT-5.6 Sol拿下了最高分。

基准测试表

基准测试(分类)Muse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
GDPVal-AA v2(知识型工作)1754161517101824
JobBench(工具使用)64.961.645.465.7
OSWorld 2.0(电脑操作)66.947.662.768.3
DeepSWE v1.1(编码)75.455.073.074.0
MRCR 512K-1M(长上下文)98.155.573.8-
Terminal-Bench 2.1(终端编码)88.882.988.886.7
이미지: @AIatMeta (X)

一个月内的第四次发布

Meta仅在上个月就三次推出了Muse系列模型。此次的Muse Spark 1.3是这一系列中的第四次发布,也是四个月内推出的模型中,编码与长上下文性能提升幅度最大的一个版本。

编辑视角

Meta在不到一个月的时间里已经四度发布Muse系列,这并非偶然。在OpenAI和Anthropic分别以GPT-5.6 Sol、Opus 5抢占智能体与编码市场之际,Meta每次都同步附上基准测试表,持续以公开方式证明自己追赶到了什么程度——这已经成为一种策略。而在长上下文处理与大规模代码库理解上集中投入开发资源的痕迹,也直接体现在了分数上。

不过在实际业务中该选哪款模型,还是取决于任务类型。如果是处理长文档或大型代码库的编码工作,Muse Spark 1.3目前可能是最领先的选择;但如果工作需要在多种办公工具之间切换、处理整体知识型任务,Opus 5的得分仍略高一筹。对国内开发团队来说,比较稳妥的做法是:先在代码审查、重构等长上下文较为重要的任务上试用Muse Spark 1.3,而常规办公自动化则可以与现有模型对比之后再慢慢过渡。

从Meta按月发布的节奏来看,下一次更新很可能会集中在缩小与GPT-5.6 Sol在指令遵循(Agentic IF Index)和网络搜索(DeepSearchQA)方面的差距上。

评论