
이미지: @AIatMeta (X) 화면 갈무리
摘要
- Meta AI介绍了内部评测框架WildArtifactBench,并率先公开了10个任务。
- 它不采用固定标准答案的评分表,而是由人类和Agent评审员通过胜率、Elo分数来评判产出成果。
- 任务涵盖从鸟鸣声分析到冠状动脉狭窄判读等多种实务型场景。
- 명칭
- WildArtifactBench
- 발표
- 메타 AI 공식 X 계정, 2026-08-20 18:25 UTC
- 형태
- 내부 평가 프레임워크(프리뷰)
- 공개 과제 수
- 10개
- 평가 방식
- 사람·에이전트 심사자의 승률(win rate)과 Elo 점수
- 과제 구성
- instruction.md · data 폴더 · rubrics.json
- 예시 과제
- Bird Sound(오디오 분석), Coronary Stenosis(관상동맥 협착 판독) 등
没有标准答案的任务该如何评分
Meta AI这次公开的不是新模型,而是评分标准本身。在当地时间20日发布的官方X账号帖子中,Meta AI首次介绍了用于评测AI Agent实务能力的内部框架"WildArtifactBench"。以往每次发布新模型都会附带性能对比表,而这次的主角变成了衡量性能的工具本身。
如今的Agent不再只是给出一个答案。它们撰写文档、生成3D模型、剪辑视频、判读医学影像。问题在于,这类产出成果并没有固定的标准答案。既无法像代码题那样"运行后判断通过或失败",也无法像数学题那样用一个数字判定对错。Meta AI介绍称,WildArtifactBench的设计目标是评测"跨多种产出格式的复杂、贴近实际业务的任务"。
用胜率和Elo分数取代标准答案
其评分方式颇为特别。不采用严格的标准答案评分表(ground-truth rubric),而是让人类评审员和其他Agent评审员对结果进行两两对决,以此计算胜率和Elo分数。这套体系直接借用了国际象棋或在线游戏排名中使用的Elo评分机制,用来判定哪个Agent的产出成果相对更优。Meta AI解释称,这种方法"将任务范围扩展到了实务型多模态工作流的各个方面"。此次率先公开的任务共有10个,Meta AI表示这是"将衡量多模态Agent实际交付的实用价值这一能力再向前推进一步"的尝试。
公开的10个任务
| 任务名称 | 分类 |
|---|---|
| Bird Sound | 音频分析 |
| Cardiac Ultrasound | 医疗健康 |
| Cat Mesh | 数字设计 |
| Coronary Stenosis | 冠状动脉造影影像分析 |
| Dqn Driving | 机器学习工程 |
| Kitchen Layout | 数字设计 |
| Materials Metrology | 材料工程定量影像分析 |
| Microchip Model | 3D建模 |
| Plywood Whale | 数字设计 |
| Video Editing | 视频编辑 |
每个任务分为三部分
从公开的任务查看器画面来看,每个任务由三个要素构成:说明要制作什么内容的instruction.md、包含图像、YAML、音频等原始输入资料的data文件夹,以及记录评分标准的rubrics.json。画面上同时显示Category、Input files、Input size、Criteria四个标签页,方便对比各任务的输入格式和难度。
如何使用
WildArtifactBench可在Meta AI开发者页面内的任务查看器中查看。画面左侧列出10个任务清单,顶部搜索栏可用于查找任务名称。
- 在任务查看器中选择想查看的任务(例如Bird Sound、Coronary Stenosis)。
- 选中任务后,画面会显示Category、Input files、Input size、Criteria标签页。
- 进入Task files标签页后,可依次打开instruction.md、data文件夹、rubrics.json。图像会自动加载,YAML需要展开才能查看,音频则仅显示元数据。
- 点击画面顶部的全部任务压缩文件,可一次性下载全部10个任务。
此次发布并未提及外部开发者的访问范围或参与条件。不过,考虑到Meta最近接连推出了类似终端编码Agent Muse Code这样的长周期任务型Agent,Dqn Driving或Microchip Model等任务有可能被用作衡量此类Agent实务性能的试金石。
编辑视角
OpenAI、Anthropic等公司虽然也在打造自有基准测试,但大多仍局限在编码、数学等有标准答案的领域。Meta将评测范围扩展到医学影像判读、3D建模、视频编辑等没有标准答案的领域,这可以解读为一个信号:Agent竞争的重心正从"谁能更好地解题"转向"谁能产出更贴近实务的成果"。在无法用标准答案评分的领域引入Elo方式,也是这一趋势的延续。未来基准测试的重心很可能会从衡量"谁更准确"逐渐转向衡量"谁更受青睐"。
将现有的Agent基准测试套用到实际业务中时,总会碰到同一堵墙:编码基准测试能衡量"是否通过测试",却无法衡量"团队是否真的会采用这段代码"。胜率、Elo方式至少是弥合这一鸿沟的第一步。
对于国内正在自行开发Agent或考虑引入相关技术的团队而言,比起性能表上的单一分数,更应该先看这个分数是通过什么方式计算出来的。在有标准答案的任务中表现出色的Agent,与擅长产出无标准答案实务成果的Agent,是两种不同的能力。相比外部基准测试的分数,针对自家文档格式和代码风格单独构建小规模评测集,对实际的引入决策更有参考价值。
如果Meta以这10个任务为起点扩大WildArtifactBench的覆盖范围,那么下一步很可能是用这套框架直接公布Muse Code等自家Agent的成绩单。




评论