OSWorld-2.0
测试AI智能体能否在真实电脑屏幕上独立完成多步骤任务的评测工具
简单来说
OSWorld-2.0就像一张考卷,把一台真实的电脑屏幕交给AI智能体,看它能不能像人一样点击鼠标、敲击键盘,把一项任务从头到尾做完。比如让它打开浏览器查找信息,再把结果复制到表格里保存下来——这种需要在真实操作系统屏幕上完成的多步骤任务,最后会根据是否全程正确完成来打分。
如果说一般的考试只是挑一个正确答案,这种测试要难得多:中途只要不小心关错了窗口,或者点错了菜单,并不会只是扣一点分,而可能导致整个任务失败。因为它同时要求AI具备看懂屏幕的能力和实际动手操作的能力,所以常被用来衡量AI是不是真的能代替人完成实际工作,而不只是说得好听。
名字里的“2.0”意味着测试题目和评分方式相比上一个版本做了进一步打磨。每当有新的AI模型发布,往往会同时公布它在这项测试中取得的分数。
