Terminal-Bench 4.0
给AI模型打分的一套测试,用来衡量它在命令行电脑环境中实际处理任务的能力
简单来说
Terminal-Bench 4.0 让AI模型坐在一个只有文字、黑屏幕的电脑环境里,然后给它完成查找文件、安装程序、修复问题等任务的表现打分。这就好比让一个新入职的程序员用真实电脑处理"把这个错误修一下"这样的任务,再根据结果评定他的实力。
这个分数之所以重要,是因为公司推出新模型时,不再只是口头宣称"比上一代更聪明",而是用这个测试分数来证明。不过,这个分数并不是纯粹的智力测量值,它也会因为模型被套上的安全防护措施介入程度不同而发生变化。
在报道中是这样出现的
文章中可能会这样出现:"Anthropic解释说,两款模型在Terminal-Bench 4.0得分上的差距,是因为此前不够精细的网络安全防护措施在部分任务中进行了干预。"这里容易产生的误解是,以为分数差距代表模型本身的"实力"不同——实际上它指的是,套在同一个模型上的安全防护措施的严密程度影响了任务执行。
