Terminal Bench 2.1
衡量AI智能体能否在电脑命令行环境中自主完成多步骤任务的测试
简单来说
Terminal Bench 2.1 是一项测试,用来衡量AI智能体在电脑的命令行界面(终端)中实际完成任务的能力。在聊天窗口里流畅回答问题,和被扔进一个陌生的办公室去查找、整理、按顺序处理文件,是完全不同的能力——这项测试衡量的是后者。
打个比方,这就像烹饪资格考试。考的不是你是否认识食材的名字,而是你能否真的站在厨房里,按顺序做出好几道菜。编写代码、执行命令、确认结果、再自主决定下一步该做什么,整个过程都是评分对象。
分数越高,意味着基于该模型打造的自动化工具越有可能在较少依赖人工干预的情况下,把复杂任务坚持做到底。不过,这一项测试并不能代表模型的全部能力。
在报道中是这样出现的
亲手试一试
如果你在使用带有编程智能体功能的工具,不妨试着交给它一项需要多个步骤才能完成的任务,而不是一次性就能答完的简单问题。比如给出这样的提示:"在这个文件夹里找到日志文件,筛选出其中的错误信息,再按日期打包压缩",然后观察智能体是否能中途不卡壳、独立完成到底——这样就能直观体会到这项测试想要衡量的能力。
