每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

电子表格分析AI测试中Claude Opus 5以54%领先

Artificial Analysis公开了新的智能体基准AA-AnalystAgent。57%的失败源于对最初假设的执念。

AI 분석 에이전트 성능을 비교한 막대그래프 리더보드

이미지: X — 벤치마크·평가 화면 갈무리

摘要

  • Artificial Analysis公开了针对实际电子表格与文档进行定量分析的智能体基准AA-AnalystAgent,Claude Opus 5以54%位列第一,GPT-5.5为50%,Claude Fable 5为49%。
  • 在单次尝试准确率pass@1上,GPT-5.5(xhigh)以66%最高,但在要求五次全部成功的pass^5指标中,Claude Opus 5反超领先。
  • 分析1567个失败案例后发现,57%属于"执着于最初错误假设"的类型;同样得分20%的模型,单次任务成本却出现0.05美元与1.34美元并存的情况。
벤치마크명
AA-AnalystAgent (Artificial Analysis 개발)
평가 대상
실제 업무용 스프레드시트·문서 기반 정량 분석 에이전트 과제
상위 점수
Claude Opus 5 54%, GPT-5.5 50%, Claude Fable 5 49%
pass@1 최고
GPT-5.5(xhigh) 66%, Gemini 3.1 Pro Preview·Claude Opus 5(max) 각 64%
실패 분석
10개 모델의 실패 시도 1,567건을 7개 실패 유형으로 분류, 초기 가설 집착이 57%
비용 격차
Claude Sonnet 4.6(max)와 MiMo-V2.5-Pro 모두 20%, 작업당 각 1.34달러·0.05달러
최고 비용 모델
Claude Opus 4.7(max), 작업당 1.98달러
오픈 가중치 1위
Kimi K3(max) 39%, 비공개 프런티어 대비 15점 차

让同一个分析任务连续做五次。若四次答对、一次答错,该题就得零分。这是独立评测机构Artificial Analysis新推出的基准AA-AnalystAgent的评分方式。结果显示,即便是最顶尖的模型,得分也刚过半数。Claude Opus 5以54%位列第一,紧随其后的是GPT-5.5的50%和Claude Fable 5的49%。

电子表格分析智能体基准排行榜
AA-AnalystAgent排行榜 · 来源:Artificial Analysis
이미지: X — 벤치마크·평가

不是考卷,而是真实文件的考试

以往对语言模型的评测,大多是文本形式的固定题目与答案。AA-AnalystAgent则不同。它直接抛出实际业务中使用的电子表格和文档,要求模型借助工具打开文件、提取数字并完成计算。这种"需要动用工具"的测试被称为智能体基准。

Artificial Analysis解释了设计这项任务的理由,称分析师工作具有其特殊性质。他们表示:"在实际分析师工作中,专业判断和专业性同样重要。"这意味着,答对一道题的能力,与给出可放心交给他人使用的分析结果的能力,是两件不同的事。

模型得分
Claude Opus 554%54
GPT-5.550%50
Claude Fable 549%49
Kimi K3(max,开放权重第一)39%39
이미지: X — 벤치마크·평가

决定排名的不是性能,而是稳定性

有意思的是,单次答对率与最终排名并不一致。单次尝试准确率(pass@1)上,GPT-5.5(xhigh)以66%最高,Gemini 3.1 Pro Preview与Claude Opus 5(max)以64%紧随其后。但在要求五次全部成功才算通过的pass^5——评测团队称之为"pass-all-5"——指标上,Opus 5反超领先。登上榜首的不是表现最好的模型,而是最不容易失误的模型。

指标第一名数值
pass@1(单次答对概率)GPT-5.5(xhigh)66%
pass@1并列第二Gemini 3.1 Pro Preview / Claude Opus 5(max)各64%
pass^5(五次全部成功)Claude Opus 5排行榜第一

此次发布的文章中并未说明作为头条数据的54%具体是以何种方式计算得出的。但pass@1与最终得分呈现不同走势这一事实本身,已经说明了这个排行榜衡量的究竟是什么。

이미지: X — 벤치마크·평가

57%的失败源于"放不下最初的假设"

评测团队收集了10个主要模型共1567次失败尝试,并将其归纳为七种失败类型,同一次尝试可被同时归入多个类型。最常见的类型是持续坚持最初设定的错误假设,这一类型出现在57%的失败案例中。

对从业者来说,这是熟悉的场景:一开始就读错了数据、定下了错误的方向,之后所有计算都顺着这个方向进行。刚入职的新人也会犯同样的错误。区别在于,人在中途会停下来想"这不对劲",而模型却会用看似合理的逻辑一直推到底。

이미지: X — 벤치마크·평가

得分相同,成本却相差27倍

叠加成本这一维度后,画面又发生了变化。Claude Sonnet 4.6(max)与MiMo-V2.5-Pro同样得分20%,但单次任务成本分别为1.34美元和0.05美元,相差27倍却得出相同结果。在顶尖模型之间也是如此,成本最高的Claude Opus 4.7(max)单次任务花费达1.98美元。

在开放权重阵营中,Kimi K3(max)以39%的成绩在发布时登上第一。与非开源的前沿模型相比差距为15分,并领先于同批测试的其他8款开放权重模型。紧随其后的是DeepSeek的DeepSeek V4 Flash。

이미지: X — 벤치마크·평가

那么这意味着什么

去年8月10日,Artificial Analysis宣布正在开发面向开发者的基准测试产品系列,并开放了抢先体验申请。AA-AnalystAgent正是这一系列工作的延续,是将办公业务原样搬上考卷的评测。对于希望让AI承担财务、会计、研究等以电子表格为核心业务的组织而言,如今又多了一项可供参考的数据。

传递的信息很简单:目前水平的智能体能够看似出色地完成一次任务,却无法连续五次都成功。这意味着,让人在不加审核的情况下直接采用其结果,时机尚早。用于执行该任务的智能体执行框架——即包裹模型、使其能够打开文件并运行代码的执行外壳——Stirrup已在GitHub上开源,任何人都可以在相同条件下亲自运行测试。不再只依赖他人发布的结果,而是能够自行验证评测的环境正在逐渐增多。