METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

电子表格分析AI测试中Claude Opus 5以54%领先

Artificial Analysis公布新版智能体基准测试AA-AnalystAgent,57%的失败源于对初始假设的执念

电子表格分析AI测试中Claude Opus 5以54%领先

摘要

  • Artificial Analysis公布了处理真实电子表格与文档的量化分析智能体基准测试AA-AnalystAgent,Claude Opus 5以54%排名第一,GPT-5.5为50%,Claude Fable 5为49%。
  • 在单次答对的pass@1指标上,GPT-5.5(xhigh)以66%最高,但在要求五次全部成功的pass^5指标上,Claude Opus 5反超领先。
  • 对1567个失败案例的分析显示,57%属于"执着于最初错误假设"的类型,同样得分20%的模型,单次任务成本却分别低至0.05美元、高达1.34美元。

同一个分析任务被要求做五次。答对四次、错一次,这道题也算零分。这是独立评测机构Artificial Analysis新推出的基准测试AA-AnalystAgent的评分方式。结果显示,即便是最顶尖的模型,得分也刚过半数。Claude Opus 5以54%排名第一,GPT-5.5以50%、Claude Fable 5以49%紧随其后。

여러 AI 모델별로 첫 시도, 다섯 번 시도, 다섯 번 모두 통과 비율을 비교한 세로 막대그래프
이미지: @ArtificialAnlys (X)

这不是做题集,而是解真实文件的考试

此前对语言模型的评测,大多是文本形式的固定题目和答案。AA-AnalystAgent则不同:给模型一个真实业务中使用的电子表格和文档,模型必须借助工具打开文件、提取数字并完成计算。这种"需要动手用工具"的测试被称为智能体基准测试。

Artificial Analysis解释了设计这项任务的原因,即分析师工作的性质。他们表示:"在实际的分析师工作中,专业判断和专业性同样重要。"这意味着,答对一道题的能力,和拿出一份可以直接交给别人使用的分析报告的能力,是两回事。

模型得分
Claude Opus 554%54
GPT-5.550%50
Claude Fable 549%49
Kimi K3(max,开放权重第一)39%39
AI 모델별 실패 모드별 실패 시도 비율을 색상으로 나타낸 열 지도 그래프
이미지: @ArtificialAnlys (X)

决定排名的不是性能,而是稳定性

有趣的是,单次答对率与最终排名出现了背离。单次尝试准确率(pass@1)方面,GPT-5.5(xhigh)以66%最高,Gemini 3.1 Pro Preview与Claude Opus 5(max)以64%紧追其后。但在要求五次全部成功才算通过的pass^5——评测团队称之为"pass-all-5"——指标上,Opus 5反而领先。排名靠前的不是表现最好的模型,而是最不容易出现波动的模型。

指标第一名数值
pass@1(单次答对概率)GPT-5.5(xhigh)66%
pass@1并列第二Gemini 3.1 Pro Preview / Claude Opus 5(max)各64%
pass^5(五次全部成功)Claude Opus 5排行榜第一

关于头条得分54%具体是如何合并计算出来的,此次公告中并未说明。但pass@1与最终得分走势不同这一事实本身,已经说明了这个排行榜究竟在衡量什么。

AI 모델별 실패 모드별 중간값 대비 실패 비율 차이를 색상으로 나타낸 열 지도 그래프
이미지: @ArtificialAnlys (X)

57%的失败源于"放不下最初的假设"

评测团队收集了10个主要模型共1567次失败尝试,将其归纳为七种失败类型,一次尝试可能同时被归入多个类型。其中最常见的类型,是持续执着于最初设定的错误假设,占全部失败案例的57%。

这对从业者来说是熟悉的场景:一开始就读错数据、定错方向,之后所有计算都顺着这个错误方向走下去。新入职的员工也常犯同样的错误。区别在于,人类会在中途停下来想"这不对劲吧",而模型却会用看似合理的逻辑一路错到底。

AI 모델별 다섯 번 모두 통과 비율과 작업당 비용을 비교한 산점도 그래프
이미지: @ArtificialAnlys (X)

得分相同,成本却相差27倍

叠加成本维度来看,画面又不一样了。Claude Sonnet 4.6(max)与MiMo-V2.5-Pro同样得分20%,但单次任务成本分别为1.34美元和0.05美元——同样的结果,成本相差27倍。在顶尖梯队中同样如此,成本最高的Claude Opus 4.7(max)单次任务耗费1.98美元。

在开放权重阵营中,Kimi K3(max)以39%的成绩在发布时登顶第一,与闭源前沿模型的差距为15个百分点,并领先于同时测试的其余8个开放权重模型。紧随其后的是DeepSeek的DeepSeek V4 Flash。

AI 모델별 오픈 가중치와 독점 가중치 모델의 다섯 번 모두 통과 비율을 비교한 세로 막대그래프
이미지: @ArtificialAnlys (X)

这意味着什么

去年8月10日,Artificial Analysis宣布正在开发面向开发者的基准测试产品套件,并开放了早期访问申请。AA-AnalystAgent正是这一系列工作的延伸,是一项把办公室日常工作直接搬进考卷的评测。对于财务、会计、研究等电子表格即是工作本身的岗位,如果有组织想让AI介入其中,如今又多了一项可以参考的数据。

信息很简单:目前水平的智能体,能做到一次像模像样,却做不到连续五次都靠谱。这意味着,让人类不加审核就直接采用其结果,为时尚早。用于执行该任务的智能体运行框架——即让模型能够打开文件、运行代码的执行外壳——名为Stirrup,已在GitHub上开源,任何人都可以在相同条件下亲自测试。不必只依赖他人发布的结果,这样的评测环境正在逐渐增多。

评论