每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Meta 首次公开AI Agent评测项目WildArtifactBench的10个任务

不采用标准答案评分,而是通过胜率和Elo分数让Agent的产出成果一较高下

AI 모델 비용 대비 성능을 비교한 벤치마크 그래프 두 개

이미지: @AIatMeta (X) 화면 갈무리

摘要

  • Meta AI介绍了内部评测框架WildArtifactBench,并率先公开了10个任务。
  • 它不采用固定标准答案的评分表,而是由人类和Agent评审员通过胜率、Elo分数来评判产出成果。
  • 任务涵盖从鸟鸣声分析到冠状动脉狭窄判读等多种实务型场景。
명칭
WildArtifactBench
발표
메타 AI 공식 X 계정, 2026-08-20 18:25 UTC
형태
내부 평가 프레임워크(프리뷰)
공개 과제 수
10개
평가 방식
사람·에이전트 심사자의 승률(win rate)과 Elo 점수
과제 구성
instruction.md · data 폴더 · rubrics.json
예시 과제
Bird Sound(오디오 분석), Coronary Stenosis(관상동맥 협착 판독) 등

没有标准答案的任务该如何评分

Meta AI这次公开的不是新模型,而是评分标准本身。在当地时间20日发布的官方X账号帖子中,Meta AI首次介绍了用于评测AI Agent实务能力的内部框架"WildArtifactBench"。以往每次发布新模型都会附带性能对比表,而这次的主角变成了衡量性能的工具本身。

如今的Agent不再只是给出一个答案。它们撰写文档、生成3D模型、剪辑视频、判读医学影像。问题在于,这类产出成果并没有固定的标准答案。既无法像代码题那样"运行后判断通过或失败",也无法像数学题那样用一个数字判定对错。Meta AI介绍称,WildArtifactBench的设计目标是评测"跨多种产出格式的复杂、贴近实际业务的任务"。

用胜率和Elo分数取代标准答案

其评分方式颇为特别。不采用严格的标准答案评分表(ground-truth rubric),而是让人类评审员和其他Agent评审员对结果进行两两对决,以此计算胜率和Elo分数。这套体系直接借用了国际象棋或在线游戏排名中使用的Elo评分机制,用来判定哪个Agent的产出成果相对更优。Meta AI解释称,这种方法"将任务范围扩展到了实务型多模态工作流的各个方面"。此次率先公开的任务共有10个,Meta AI表示这是"将衡量多模态Agent实际交付的实用价值这一能力再向前推进一步"的尝试。

公开的10个任务

任务名称分类
Bird Sound音频分析
Cardiac Ultrasound医疗健康
Cat Mesh数字设计
Coronary Stenosis冠状动脉造影影像分析
Dqn Driving机器学习工程
Kitchen Layout数字设计
Materials Metrology材料工程定量影像分析
Microchip Model3D建模
Plywood Whale数字设计
Video Editing视频编辑

每个任务分为三部分

从公开的任务查看器画面来看,每个任务由三个要素构成:说明要制作什么内容的instruction.md、包含图像、YAML、音频等原始输入资料的data文件夹,以及记录评分标准的rubrics.json。画面上同时显示Category、Input files、Input size、Criteria四个标签页,方便对比各任务的输入格式和难度。

如何使用

WildArtifactBench可在Meta AI开发者页面内的任务查看器中查看。画面左侧列出10个任务清单,顶部搜索栏可用于查找任务名称。

  1. 在任务查看器中选择想查看的任务(例如Bird Sound、Coronary Stenosis)。
  2. 选中任务后,画面会显示Category、Input files、Input size、Criteria标签页。
  3. 进入Task files标签页后,可依次打开instruction.md、data文件夹、rubrics.json。图像会自动加载,YAML需要展开才能查看,音频则仅显示元数据。
  4. 点击画面顶部的全部任务压缩文件,可一次性下载全部10个任务。

此次发布并未提及外部开发者的访问范围或参与条件。不过,考虑到Meta最近接连推出了类似终端编码Agent Muse Code这样的长周期任务型Agent,Dqn Driving或Microchip Model等任务有可能被用作衡量此类Agent实务性能的试金石。

编辑视角

OpenAIAnthropic等公司虽然也在打造自有基准测试,但大多仍局限在编码、数学等有标准答案的领域。Meta将评测范围扩展到医学影像判读、3D建模、视频编辑等没有标准答案的领域,这可以解读为一个信号:Agent竞争的重心正从"谁能更好地解题"转向"谁能产出更贴近实务的成果"。在无法用标准答案评分的领域引入Elo方式,也是这一趋势的延续。未来基准测试的重心很可能会从衡量"谁更准确"逐渐转向衡量"谁更受青睐"。

将现有的Agent基准测试套用到实际业务中时,总会碰到同一堵墙:编码基准测试能衡量"是否通过测试",却无法衡量"团队是否真的会采用这段代码"。胜率、Elo方式至少是弥合这一鸿沟的第一步。

对于国内正在自行开发Agent或考虑引入相关技术的团队而言,比起性能表上的单一分数,更应该先看这个分数是通过什么方式计算出来的。在有标准答案的任务中表现出色的Agent,与擅长产出无标准答案实务成果的Agent,是两种不同的能力。相比外部基准测试的分数,针对自家文档格式和代码风格单独构建小规模评测集,对实际的引入决策更有参考价值。

如果Meta以这10个任务为起点扩大WildArtifactBench的覆盖范围,那么下一步很可能是用这套框架直接公布Muse Code等自家Agent的成绩单。

评论