OSWorld-2.0
AI 에이전트가 실제 컴퓨터 화면에서 여러 단계의 작업을 스스로 완수하는지 시험하는 평가 도구
쉽게 말하면
OSWorld-2.0은 AI 에이전트에게 진짜 컴퓨터 화면을 주고, 사람처럼 마우스를 클릭하고 키보드를 눌러 일을 끝까지 해내는지 시험하는 시험지 같은 것이다. 예를 들어 브라우저를 열어 정보를 찾고, 그 결과를 스프레드시트에 옮겨 저장하는 식의 여러 단계짜리 작업을 실제 운영체제 화면 위에서 수행하게 한 뒤, 끝까지 제대로 마쳤는지를 채점한다.
일반적인 시험이 정답 하나를 고르는 방식이라면, 이런 시험은 중간에 창을 잘못 닫거나 엉뚱한 메뉴를 눌러도 감점 없이 넘어가는 게 아니라 전체 과정이 실패로 이어질 수 있다는 점에서 훨씬 까다롭다. 화면을 보고 이해하는 능력과 실제로 손을 움직이는 능력을 동시에 요구하기 때문에, AI가 단순히 말을 잘하는 수준을 넘어 실제 업무를 대신할 수 있는지 가늠하는 잣대로 쓰인다.
숫자 2.0이 붙은 건 이전 버전보다 시험 문제나 채점 방식이 더 다듬어졌다는 뜻으로 이해하면 된다. 새로운 AI 모델이 발표될 때마다 이런 시험을 통과한 점수가 함께 공개되는 경우가 많다.
