每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Artificial Analysis推出Optima,用用户自有数据为AI模型打分

不止比较质量,还能比较每项任务的成本与耗时的定制化基准测试平台亮相

이미지: The Decoder

摘要

  • Artificial Analysis推出了Optima平台,用户可用自己的数据和工作流程创建定制化基准测试
  • 可通过上传现有评测数据集、接入智能体轨迹工具、在编码会话中安装技能这三种方式收集数据
  • 早期测试者利用财务·会计智能体基准测试,找到了在不降低质量的前提下将成本降低至十分之一的模型
原文视频
제품명
Optima
개발사
Artificial Analysis
핵심 기능
사용자 데이터 기반 맞춤 벤치마크 생성 및 모델 비교
비교 축
품질, 과제당 비용(cost per task), 과제당 시간(time per task)
데이터 입력 경로
자체 파일·허깅페이스 데이터셋 / Arize·Braintrust·Langfuse 에이전트 트레이스 / 코딩 세션 스킬
채점 방식
루브릭 기반 평가, 페어와이즈(쌍대 비교) 평가 2종
공개 사례
재무·회계 에이전트 벤치마크로 비용 10분의 1 절감 모델 발견

为什么一个基准分数还不够

选择AI模型时,人们通常参考的是类似智力指数这样的综合得分。但实际投入业务使用后发现,分数高的模型未必总是最佳选择。如果同一项任务需要反复重试多次,或者输出结果还需要人工返工,那么即便每个token单价便宜,实际总成本也可能更高。Artificial Analysis正是针对这一问题,推出了名为Optima的平台。

Artificial Analysis是一家独立评测公司,此前曾推出GDPval-AA、AA-Briefcase等基准测试。这次公开的Optima并非通用型基准测试,而是一款让模型基于用户自身数据和工作流程展开竞赛的工具。据该公司介绍,用户可以输入自己的数据、工作流程,或是描述所需的场景来创建基准测试,并将其应用于当前主流模型,同时比较质量、单任务成本和单任务耗时。

即便没有数据也能开始的三条路径

Optima在数据收集方式上开辟了三条路径。已经拥有评测数据集的用户可以直接从自有文件或Hugging Face导入;正在运行智能体的团队可以从Arize、Braintrust、Langfuse等轨迹工具中提取记录;开发者则可以在编码环境中安装技能,自动收集过往会话信息。

输入路径适用对象方式
现有评测数据集已拥有数据的团队上传自有文件或Hugging Face
智能体轨迹运行智能体的团队接入Arize、Braintrust、Langfuse
编码会话技能开发者在编码环境安装技能,自动收集过往会话

即便完全没有数据也没关系。只需描述想要使用的场景,并提供几个示例输入输出,Optima就会自动生成并提议测试输入、评估标准和示例任务。用户对此进行审核,并通过反馈进行调整,随后即可运行实际的基准测试。

两种评分方式,三项结果指标

评分方式有两种。一种是按照客观标准对答案进行评估的评分标准方式,另一种是Artificial Analysis在GDPval-AA、AA-Briefcase中也采用的成对比较方式。在成对比较方式中,用户先查看部分应答对并标注哪一方更优,Optima随后基于这一偏好对整个数据集进行排序。

比较结果并不止于一个质量分数。单任务成本和单任务耗时也会作为独立的比较维度一并呈现。在智能体型应用中,仅凭token单价很难判断实际成本。即便模型价格便宜,若尝试次数增多或失败率高,又或者输出结果需要人工返工,总成本反而会更高。每完成一项任务实际花费的成本,才是更真实的数字。

实际得到验证的应用案例

据Artificial Analysis介绍,部分早期测试者创建了财务·会计智能体专用基准测试,找到了在不明显降低质量的前提下能将成本降至十分之一的模型。这可以视为Optima所瞄准的问题——即通用基准测试无法揭示的特定业务环境下的最优模型选择——确实行之有效的案例。

如何使用

Optima目前已可使用。按照该公司介绍的流程,可以按以下步骤创建基准测试。

  1. 选择素材 — 从文件或Hugging Face导入已有的评测数据集,或者如果正在运行智能体,可接入Arize、Braintrust、Langfuse轨迹。如果是开发团队,可以在编码环境中安装技能,自动收集过往会话数据。
  2. 没有数据时用描述开始 — 用文字描述想要使用的场景,并输入几个示例输入输出。Optima会提议测试输入、评估标准和示例任务。
  3. 完善提议内容 — 审核收到的测试构成建议,并结合反馈调整成想要的形式。
  4. 选择评分方式 — 在按客观标准评分的评分标准方式,与通过比较应答对进行排序的成对比较方式之间做出选择。
  5. 执行并比较 — 将基准测试应用于当前主流模型,并排比较质量、单任务成本和单任务耗时。

关于具体国家、付费方案、平台限制等使用条件,此次公告并未明确说明。不过在应用范围内,已能想到一些立即可行的场景。例如,运营客服智能体的团队可以将实际咨询日志作为轨迹输入,确认哪种模型能在保持应答质量的同时缩短处理时间。开发团队则可以输入通过技能收集的过往会话数据,比较哪种模型在重构或修复漏洞等任务中失败率更低。

去年8月10日,Artificial Analysis曾通过其官方X账号表示正在筹备面向开发者的新AI基准测试产品系列,并开放了早期访问申请。此次Optima的发布,似乎正是该产品系列的具体成果。

编辑视角

这次发布很好地展现了AI模型选择标准正从"智力指数得了多少分"转向"在我的业务中究竟能多便宜多快地完成任务"这一趋势。就在Grok 4.6以61分智力指数与GPT-5.6 Sol并列的消息传出仅数天之后,当初制定排名的公司自己就承认了"仅凭那个分数还不够"。此前已有实务型基准测试显示,Grok 4.6在除Claude Opus 5之外的大多数模型中表现相当或更优,而单任务成本却低得多——这已经说明综合得分和实际成本效益是两码事。Optima就是在提议,让个人和企业亲自去衡量这道鸿沟。

在实务中试用模型时,总会反复出现类似的模式。如果直接套用基准排行榜第一名的模型,在某些特定任务上反而经常需要多次修改答案,或是格式不符而需要人工介入。相反,排名较低的模型在某些特定领域却常常能一次性准确完成,毫无差错。综合得分终究只是平均值,并不能保证自己的业务恰好落在那个平均值范围内。

对于国内企业而言,与其立即全面引入这一工具,不如先在某一个具体工作流程上进行试点应用。比如选择客服应答或文档摘要这类失败损失显而易见的业务之一,衡量其单任务成本和耗时,就能用数字确认当前使用的模型是否真的是最佳选择。不过,基准测试设计本身如果不严谨,结果也同样不可靠这一点不会改变。在成对比较评估中,最初几个应答对的判断方式会左右整体排名,因此团队内部提前就初始判断标准达成一致,会更为稳妥。

预计未来几周内,其他评测公司或云服务商也很可能推出类似的"定制化基准测试"工具。基准测试市场本身正在从"谁能出更精准的考卷"转向"谁能替我量身定制适合我业务的考卷"。