METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅌ使用中会遇到的词

TerminalBench 3.0

衡量AI能否在终端(命令行)环境中独立完成编程任务的基准测试。

简单来说

TerminalBench 3.0是一项测试,用来衡量AI模型在终端——一个只能靠输入文字命令操作的界面——里,能像真正的开发者一样完成编程任务到什么程度。给出一个问题后,AI必须自己输入命令来解决,再根据结果是否正确来打分。

打个比方,就像让一位厨师只拿到一个食材仓库,没有食谱、没有带按钮的厨具,完全靠双手完成一道菜,然后评审这道菜做得有多准确。因为不能靠点击画面上的菜单或图标,只能用文字下达指令,这样就能纯粹地衡量AI在没有人类帮助的情况下能多大程度上自主解决问题。

这个分数常被用来比较各类编程辅助AI工具的实力。分数越高,说明AI越能在没有人工介入的情况下,独立完成复杂的开发任务。

在报道中是这样出现的

文章提到,Qwen3.8-Max-0902在TerminalBench 3.0上得到29.0分,相比上一版本的11.3分大幅提升,但仍不及Claude Opus 5的42.7分。这里容易产生的误解是,分数低并不代表AI整体的编程能力差。TerminalBench 3.0只是众多编程指标中的一项,专门衡量AI在终端环境中独立完成任务的自主能力。同一篇文章中提到,Qwen在自家基准QwenSWEBench V2上反而超过了Claude Opus 5,可见排名会因测试种类不同而变化。

相关词条

出现过这个词的报道

浏览全部词条