
이미지: X — 벤치마크·평가 화면 갈무리
摘要
- Artificial Analysis公开了针对实际电子表格与文档进行定量分析的智能体基准AA-AnalystAgent,Claude Opus 5以54%位列第一,GPT-5.5为50%,Claude Fable 5为49%。
- 在单次尝试准确率pass@1上,GPT-5.5(xhigh)以66%最高,但在要求五次全部成功的pass^5指标中,Claude Opus 5反超领先。
- 分析1567个失败案例后发现,57%属于"执着于最初错误假设"的类型;同样得分20%的模型,单次任务成本却出现0.05美元与1.34美元并存的情况。
- 벤치마크명
- AA-AnalystAgent (Artificial Analysis 개발)
- 평가 대상
- 실제 업무용 스프레드시트·문서 기반 정량 분석 에이전트 과제
- 상위 점수
- Claude Opus 5 54%, GPT-5.5 50%, Claude Fable 5 49%
- pass@1 최고
- GPT-5.5(xhigh) 66%, Gemini 3.1 Pro Preview·Claude Opus 5(max) 각 64%
- 실패 분석
- 10개 모델의 실패 시도 1,567건을 7개 실패 유형으로 분류, 초기 가설 집착이 57%
- 비용 격차
- Claude Sonnet 4.6(max)와 MiMo-V2.5-Pro 모두 20%, 작업당 각 1.34달러·0.05달러
- 최고 비용 모델
- Claude Opus 4.7(max), 작업당 1.98달러
- 오픈 가중치 1위
- Kimi K3(max) 39%, 비공개 프런티어 대비 15점 차
让同一个分析任务连续做五次。若四次答对、一次答错,该题就得零分。这是独立评测机构Artificial Analysis新推出的基准AA-AnalystAgent的评分方式。结果显示,即便是最顶尖的模型,得分也刚过半数。Claude Opus 5以54%位列第一,紧随其后的是GPT-5.5的50%和Claude Fable 5的49%。


不是考卷,而是真实文件的考试
以往对语言模型的评测,大多是文本形式的固定题目与答案。AA-AnalystAgent则不同。它直接抛出实际业务中使用的电子表格和文档,要求模型借助工具打开文件、提取数字并完成计算。这种"需要动用工具"的测试被称为智能体基准。
Artificial Analysis解释了设计这项任务的理由,称分析师工作具有其特殊性质。他们表示:"在实际分析师工作中,专业判断和专业性同样重要。"这意味着,答对一道题的能力,与给出可放心交给他人使用的分析结果的能力,是两件不同的事。
| 模型 | 得分 | |
|---|---|---|
| Claude Opus 5 | 54% | |
| GPT-5.5 | 50% | |
| Claude Fable 5 | 49% | |
| Kimi K3(max,开放权重第一) | 39% |

决定排名的不是性能,而是稳定性
有意思的是,单次答对率与最终排名并不一致。单次尝试准确率(pass@1)上,GPT-5.5(xhigh)以66%最高,Gemini 3.1 Pro Preview与Claude Opus 5(max)以64%紧随其后。但在要求五次全部成功才算通过的pass^5——评测团队称之为"pass-all-5"——指标上,Opus 5反超领先。登上榜首的不是表现最好的模型,而是最不容易失误的模型。
| 指标 | 第一名 | 数值 |
|---|---|---|
| pass@1(单次答对概率) | GPT-5.5(xhigh) | 66% |
| pass@1并列第二 | Gemini 3.1 Pro Preview / Claude Opus 5(max) | 各64% |
| pass^5(五次全部成功) | Claude Opus 5 | 排行榜第一 |
此次发布的文章中并未说明作为头条数据的54%具体是以何种方式计算得出的。但pass@1与最终得分呈现不同走势这一事实本身,已经说明了这个排行榜衡量的究竟是什么。

57%的失败源于"放不下最初的假设"
评测团队收集了10个主要模型共1567次失败尝试,并将其归纳为七种失败类型,同一次尝试可被同时归入多个类型。最常见的类型是持续坚持最初设定的错误假设,这一类型出现在57%的失败案例中。
对从业者来说,这是熟悉的场景:一开始就读错了数据、定下了错误的方向,之后所有计算都顺着这个方向进行。刚入职的新人也会犯同样的错误。区别在于,人在中途会停下来想"这不对劲",而模型却会用看似合理的逻辑一直推到底。

得分相同,成本却相差27倍
叠加成本这一维度后,画面又发生了变化。Claude Sonnet 4.6(max)与MiMo-V2.5-Pro同样得分20%,但单次任务成本分别为1.34美元和0.05美元,相差27倍却得出相同结果。在顶尖模型之间也是如此,成本最高的Claude Opus 4.7(max)单次任务花费达1.98美元。
在开放权重阵营中,Kimi K3(max)以39%的成绩在发布时登上第一。与非开源的前沿模型相比差距为15分,并领先于同批测试的其他8款开放权重模型。紧随其后的是DeepSeek的DeepSeek V4 Flash。

那么这意味着什么
去年8月10日,Artificial Analysis宣布正在开发面向开发者的基准测试产品系列,并开放了抢先体验申请。AA-AnalystAgent正是这一系列工作的延续,是将办公业务原样搬上考卷的评测。对于希望让AI承担财务、会计、研究等以电子表格为核心业务的组织而言,如今又多了一项可供参考的数据。
传递的信息很简单:目前水平的智能体能够看似出色地完成一次任务,却无法连续五次都成功。这意味着,让人在不加审核的情况下直接采用其结果,时机尚早。用于执行该任务的智能体执行框架——即包裹模型、使其能够打开文件并运行代码的执行外壳——Stirrup已在GitHub上开源,任何人都可以在相同条件下亲自运行测试。不再只依赖他人发布的结果,而是能够自行验证评测的环境正在逐渐增多。



