每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Meta Muse Spark 1.2,智能指数54分并列第三

按Artificial Analysis统计,4个月内第三次发布新模型,代理式工作能力有所提升

이미지: X — 벤치마크·평가

摘要

  • Meta发布了Muse Spark 1.2,在评测机构Artificial Analysis的统计中获得智能指数(Intelligence Index)54分。
  • 该模型是Meta在4个月内推出的第三个版本,相比此前版本,其代理式知识工作能力被评价为有明显提升。
  • 据悉54分与SpaceXAI并列第三,具体各项细分得分并未在公开内容中披露。
모델명
Muse Spark 1.2
개발사
메타(Meta)
평가 지표
Artificial Analysis Intelligence Index
점수
54점
순위
SpaceXAI와 공동 3위
릴리스 빈도
4개월 동안 세 번째 공개
개선 영역
에이전틱 지식 노동(agentic knowledge work) 능력
공개 확인 시점
2026년 8월 5일(평가 기관 게시 기준)

Meta发布Muse Spark 1.2

Meta发布了新模型Muse Spark 1.2。评测机构Artificial Analysis表示,该模型在其智能指数(Intelligence Index)评测中获得54分。该分数与SpaceXAI持平,两者并列第三。至于第一、二名分别是哪些模型,以及各模型之间的具体分差,此次公开的内容中均未提及。

与Artificial Analysis智能指数相关的图片
Muse Spark 1.2评测结果 · 来源:Artificial Analysis

4个月内第三次发布

值得关注的是发布节奏。据Artificial Analysis透露,Muse Spark 1.2是Meta在4个月内推出的第三个模型。以较短周期持续更新版本、逐步提升分数的方式,被解读为意在缩小与头部阵营的差距。

项目已确认内容
模型Muse Spark 1.2
智能指数54
排名并列第三(与SpaceXAI持平)
发布周期4个月内3次
主要改进点代理式知识工作

改进重点为"代理式知识工作"

评测机构评价称,与此前版本相比,该版本在代理式任务执行能力方面有明显提升。Artificial Analysis的表述是"significantly improving agentic knowledge work capabilities"。这被解读为,相较于一次性问答,该模型在处理文档、检索、工具调用等需要多步骤衔接的任务中得分有所提高。不过,具体哪些细分评测项目提升了多少,并未给出详细数值。

各模型智能指数及代理能力评测方式的变化动态,可在METAL LAB的基准测试相关报道中持续关注。

尚未确认的部分

目前公开的信息仅基于评测机构的一篇帖子。模型权重是否公开、上下文长度、定价政策、训练与推理基础设施等技术规格均未得到确认。被提及并列第三的SpaceXAI具体是哪款模型,同样没有明确说明。

分类状态
智能指数得分已确认
排名已确认(并列第三)
细分基准测试项目未公开
模型规格及发布形式未公开
第一、二名模型未提及

随着更多基准测试结果和Meta官方发布的公布,该分数的意义以及竞争格局或将得到更准确的判断。