One email each morning — yesterday's AI, sortedGet it in your inbox

METAL LAB

AI 용어사전쓰다 보면 만나는 말

와일드아티팩트벤치

WildArtifactBench

메타 AI가 공개한 AI 에이전트 평가용 프레임워크로, 정답표 대신 결과물끼리 대결시켜 승률과 순위 점수를 매긴다.

쉽게 말하면

와일드아티팩트벤치는 메타 AI가 만든 AI 에이전트 채점 도구다. 요리 대회에 비유하면 이해가 쉽다. 참가자의 요리를 하나의 정답 채점표로 판정하기 어려운 것처럼, AI 에이전트가 문서를 쓰고 3D 모델을 만들고 영상을 편집한 결과물에도 정해진 정답이 없다. 그래서 이 도구는 정답을 대조하는 대신, 두 에이전트의 결과물을 나란히 놓고 사람과 다른 에이전트가 어느 쪽이 더 나은지 판정하게 한다.

이렇게 쌓인 판정 결과는 체스 랭킹에서 쓰는 점수 계산 방식으로 누적돼, 에이전트마다 승률과 순위 점수가 매겨진다. 새 모델이 나올 때마다 함께 발표되던 성능 표 대신, 그 표를 만드는 채점 기준 자체를 공개한 셈이다.

첫 공개 당시 새 소리 분석, 심장 초음파 판독, 고양이 3D 모델링, 영상 편집 등 실무에 가까운 과제 10개가 함께 나왔다. 각 과제는 무엇을 만들라는 지시문, 참고할 이미지·오디오 같은 원본 자료, 채점 기준 이렇게 세 조각으로 구성돼 있다.

기사에서 이렇게 나와요

기사에서는 "메타 AI가 공식 X 계정에서 AI 에이전트 평가용 프레임워크 와일드아티팩트벤치를 처음 공개했다"는 식으로 등장한다. 이름 때문에 새로운 AI 모델로 오해하기 쉽지만, 실제로는 모델이 아니라 에이전트의 산출물을 심사하는 채점 기준 자체를 가리키는 말이다.

직접 해보기

  1. 메타 AI 개발자 페이지의 과제 뷰어에서 관심 있는 과제(예: Bird Sound, Coronary Stenosis)를 하나 고른다.
  2. 과제별로 제공되는 지시문, 입력 자료, 채점 기준을 하나씩 열어본다.
  3. 전체 과제 압축 파일을 내려받으면 공개된 10개 과제를 한 번에 확인할 수 있다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기