와일드아티팩트벤치
WildArtifactBench
메타 AI가 공개한 AI 에이전트 평가용 프레임워크로, 정답표 대신 결과물끼리 대결시켜 승률과 순위 점수를 매긴다.
쉽게 말하면
와일드아티팩트벤치는 메타 AI가 만든 AI 에이전트 채점 도구다. 요리 대회에 비유하면 이해가 쉽다. 참가자의 요리를 하나의 정답 채점표로 판정하기 어려운 것처럼, AI 에이전트가 문서를 쓰고 3D 모델을 만들고 영상을 편집한 결과물에도 정해진 정답이 없다. 그래서 이 도구는 정답을 대조하는 대신, 두 에이전트의 결과물을 나란히 놓고 사람과 다른 에이전트가 어느 쪽이 더 나은지 판정하게 한다.
이렇게 쌓인 판정 결과는 체스 랭킹에서 쓰는 점수 계산 방식으로 누적돼, 에이전트마다 승률과 순위 점수가 매겨진다. 새 모델이 나올 때마다 함께 발표되던 성능 표 대신, 그 표를 만드는 채점 기준 자체를 공개한 셈이다.
첫 공개 당시 새 소리 분석, 심장 초음파 판독, 고양이 3D 모델링, 영상 편집 등 실무에 가까운 과제 10개가 함께 나왔다. 각 과제는 무엇을 만들라는 지시문, 참고할 이미지·오디오 같은 원본 자료, 채점 기준 이렇게 세 조각으로 구성돼 있다.
기사에서 이렇게 나와요
직접 해보기
- 메타 AI 개발자 페이지의 과제 뷰어에서 관심 있는 과제(예: Bird Sound, Coronary Stenosis)를 하나 고른다.
- 과제별로 제공되는 지시문, 입력 자료, 채점 기준을 하나씩 열어본다.
- 전체 과제 압축 파일을 내려받으면 공개된 10개 과제를 한 번에 확인할 수 있다.
함께 볼 용어
이 용어가 나온 기사
- 데이터브릭스, 기업 문서 추론 벤치마크 'OfficeQA Pro V2' 공개Products · 2026.08.12
- 아티피셜 애널리시스, 내 데이터로 AI 모델 채점하는 Optima 출시Products · 2026.08.16
- 파이어폭스 스마트 윈도우, AI 답변에 실시간 출처 링크 붙인다Products · 2026.08.19
- 모빌아이, AI 에이전트로 티켓 처리 90% 단축Business · 2026.08.06
- 메타 AI 맥용 데스크톱 앱 출시, 앱 화면 통째로 물어본다Products · 2026.08.20
- AI 에이전트용 검색 API, 품질·비용·속도로 줄 세운 지수 나왔다Models · 2026.08.19