METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅌ报道中常见的技术词

Terminal Bench 2.1

衡量AI智能体能否在电脑命令行环境中自主完成多步骤任务的测试

简单来说

Terminal Bench 2.1 是一项测试,用来衡量AI智能体在电脑的命令行界面(终端)中实际完成任务的能力。在聊天窗口里流畅回答问题,和被扔进一个陌生的办公室去查找、整理、按顺序处理文件,是完全不同的能力——这项测试衡量的是后者。

打个比方,这就像烹饪资格考试。考的不是你是否认识食材的名字,而是你能否真的站在厨房里,按顺序做出好几道菜。编写代码、执行命令、确认结果、再自主决定下一步该做什么,整个过程都是评分对象。

分数越高,意味着基于该模型打造的自动化工具越有可能在较少依赖人工干预的情况下,把复杂任务坚持做到底。不过,这一项测试并不能代表模型的全部能力。

在报道中是这样出现的

文章中常用它来比较模型之间的排名,比如"DeepSeek V4-Pro在Terminal Bench 2.1上获得87.9分,超过了Opus-4.8(85.0分)"。一个常见的误解是把这个分数当作模型整体智能水平的体现,但实际上,它衡量的只是模型在终端环境中完成实际任务的狭窄能力。同一个模型在其他基准测试(如HLE、Cybergym等)上的排名也可能截然不同。

亲手试一试

如果你在使用带有编程智能体功能的工具,不妨试着交给它一项需要多个步骤才能完成的任务,而不是一次性就能答完的简单问题。比如给出这样的提示:"在这个文件夹里找到日志文件,筛选出其中的错误信息,再按日期打包压缩",然后观察智能体是否能中途不卡壳、独立完成到底——这样就能直观体会到这项测试想要衡量的能力。

相关词条

出现过这个词的报道

浏览全部词条