
摘要
- Meta发布了Muse Spark 1.2,在评测机构Artificial Analysis的统计中获得Intelligence Index 54分。
- 该模型是Meta在4个月内推出的第三款模型,相较此前版本,在代理式知识工作能力方面获得了明显提升的评价。
- 据悉54分与SpaceXAI并列第三,具体细分项得分未在公开内容中披露。
Meta发布Muse Spark 1.2
Meta发布了新模型Muse Spark 1.2。评测机构Artificial Analysis表示,该模型在其Intelligence Index评测中获得54分。据介绍,该分数与SpaceXAI持平,两者并列第三。第一、二名分别是哪些模型、各模型之间的具体分差如何,本次公开内容中均未提及。
4个月内第三次发布
值得关注的是发布节奏。据Artificial Analysis介绍,Muse Spark 1.2是Meta在4个月内推出的第三款模型。以较短周期持续更新版本、不断提升分数的方式,被解读为意在缩小与头部阵营的差距。
| 项目 | 已确认内容 |
|---|---|
| 模型 | Muse Spark 1.2 |
| 智能指数 | 54 |
| 排名 | 并列第三(与SpaceXAI持平) |
| 发布周期 | 4个月内3次 |
| 主要改进点 | 代理式知识工作 |
改进重点为"代理式知识工作"
评测机构指出,与此前版本相比,本次版本在代理式任务执行能力上有明显提升。Artificial Analysis将其描述为"significantly improving agentic knowledge work capabilities"。这被解读为,相较于单次问答,该模型在跨越多个步骤处理文档、检索、工具调用等任务上的得分有所提高。不过具体哪些细分评测项提升了多少,并未给出详细数值。
关于各模型智能指数及代理性能评测方式的变化趋势,可在METAL LAB相关基准测试报道中继续关注。
尚未确认的部分
目前公开的信息均基于评测机构的单篇发文。模型权重是否公开、上下文长度、定价政策、训练与推理基础设施等技术规格均未确认。与之并列的SpaceXAI具体对应哪款模型,同样未被提及。
| 分类 | 状态 |
|---|---|
| 智能指数得分 | 已确认 |
| 排名 | 已确认(并列第三) |
| 细分基准测试项目 | 未公开 |
| 模型规格及发布形式 | 未公开 |
| 第一、二名模型 | 未提及 |
预计随着更多基准测试结果及Meta官方发布信息的公布,这一分数的意义及竞争格局将得到更准确的判断。





评论