
이미지: The Decoder
摘要
- Artificial Analysis发布了"Search Index",从质量、成本、速度三方面评测7款AI智能体专用搜索API
- 在相同的GPT-5.6 Luna模型上仅更换搜索提供商进行测试,结果显示Parallel、Exa、Firecrawl分别以75分、74分、73分位居前列
- 测试还证实,搜索质量越高,智能体消耗的Token越少,总体成本也随之下降
- 벤치마크명
- Search Index
- 개발사
- Artificial Analysis
- 테스트 모델
- GPT-5.6 Luna (모든 제공자 공통 적용)
- 테스트 프레임워크
- Stirrup (아티피셜 애널리시스의 오픈소스 에이전트 프레임워크)
- 테스트 대상
- Parallel, Exa, Firecrawl, You.com, Tavily, Keenable, Brave (7개 제공자)
- 점수 범위
- 검색 미사용 33점 → 검색 사용 65~75점
- 상위 3사 점수
- Parallel 75, Exa 74, Firecrawl 73
- 비용 비교
- Parallel Search(advanced) 과제당 총비용 $0.084, Basic $0.11
不用搜索的智能体得33分,用了最高可达75分
如果去掉AI智能体的搜索功能,得分会跌到多低?根据Artificial Analysis发布的新基准测试"Search Index",答案是33分。同一模型接上搜索API后,得分会跃升至65到75分之间。这意味着,仅"搜索"这一项功能,就能左右智能体近一半的表现。
Artificial Analysis并不亲自开发模型,而是一家专门给模型"打分"的公司:让各类模型接受一系列测试并汇总成单一分数,同时测量其速度和价格。每当有新模型发布时,新闻中常被引用的"某某指数得分",大多正是出自这家公司之手。去年8月16日,该公司还推出了Optima,让用户可以用自己的数据构建定制基准测试。而此次的Search Index,正是该评分业务在"搜索API"这一具体领域的延伸成果。

为什么要单独给搜索API打分
AI智能体——不只是回答问题,还能搜索信息、生成文件、代为完成预约等任务的AI——在查找最新信息或散落在网络各处的事实时,依赖外部搜索API。问题在于,不同搜索提供商在结果质量、响应速度和计费方式上各不相同。开发者选用哪家搜索API,即便模型相同,实际任务成功率和成本也可能大相径庭。然而迄今为止,业内一直缺乏一个能够对这些差异进行并列比较的标准测试。
Search Index正是针对这一空白而设计。测试针对Parallel、Exa、Firecrawl、You.com、Tavily、Keenable、Brave这7家提供商,在同一个GPT-5.6 Luna模型上仅更换搜索提供商进行比较。智能体运行在Artificial Analysis名为Stirrup的开源框架之上,每个任务需反复执行25次搜索与网页浏览操作。
三项测试合并为一个分数
Search Index的分数,是三项权重相同的基准测试之和。DeepSearchQA由900道研究型问题组成,每道题都需要多次搜索查询才能找到答案。BrowseComp子集包含200个高难度事实类问题,需要经过多步浏览才能找到答案。AA-Omniscience则涵盖六大知识领域的600道问题。此外还设置了一个"不使用工具"的基准线——即模型完全依靠自身作答,用以比较搜索API实际带来了多大帮助。
| 项目 | 得分 |
|---|---|
| 不使用搜索(基准线) | 33 |
| Firecrawl | 73 |
| Exa | 74 |
| Parallel | 75 |
质量越高,成本反而越低
值得关注的一点是:搜索结果质量越高,模型找到答案所消耗的Token数量就越少。Parallel Search的高级版(advanced)相比基础版(Basic),Token使用量减少了超过40%。虽然按单次查询计算,advanced版的搜索成本更高,但完成一项完整任务的总成本反而更低——advanced为0.084美元,Basic为0.11美元。
速度方面也出现了类似的反转现象。Parallel Search的超高速版本(turbo)单次查询响应时间为0.51秒,是Basic版本1.03秒的两倍快。但其质量得分为67分,低于Basic的73分,这意味着智能体为了得到满意答案,需要多次反复搜索。最终,完成一项任务所需的总时间,两个版本相差无几。Artificial Analysis认为,在成本与性能之间平衡最佳的组合是Parallel、Firecrawl以及Parallel(turbo)。
参与渠道仍然开放
Search Index目前以7家提供商起步,但并非一份封闭的基准测试。其他搜索API提供商也可以向Artificial Analysis提出申请加入该指数,完整的评分方法也已通过公开的方法论文档供所有人查阅。
编辑视角
这项基准测试之所以引人注目,是因为它评测的对象不是"模型",而是"零部件"。此前的AI性能比较几乎清一色是模型对模型的较量——GPT好还是Claude好,这一版比上一版聪明了多少。然而对于真正运行智能体的开发者来说,搜索API、代码执行环境、文档解析器等周边组件的选择,与模型选择同样能决定最终结果。上周Artificial Analysis刚推出Optima,让用户"用自己的数据打造定制基准",本周紧接着又推出搜索API评分表,这一系列动作显示,该公司正持续把评测对象从"模型"进一步拆解到"智能体组件"这一更细的层级。
在实际工作中接入过搜索API的人,对这个结果应该不陌生。选择响应速度快的搜索引擎,结果却因为结果质量不佳,导致模型对同一问题反复查询三四次,最终总耗时和总成本反而更高——这种情况并不少见。此次测试中Parallel Search(turbo)与Basic版本最终总耗时趋于一致的结果,恰好用数据印证了这一模式。这也说明,不能仅凭"每秒响应速度"来选择API。
对于国内正在开发搜索型智能体的团队而言,当务之急是重新核算一下目前所用搜索API完成单个任务的总成本。真正的成本高低,不能只看单次查询费用,而要综合考察完成一项任务所消耗的Token总量与重试次数。可以预见,这一指数在未来几周内很可能会吸引更多提供商加入——毕竟这类开放式基准测试,总会吸引那些渴望跻身榜单前列的公司率先申请。届时,Search Index有望成为搜索API市场的基本参照标准。


