METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典S报道中常见的技术词

SWE-bench Verified

一个用来自动评分AI编程助手修复真实开源项目中实际bug能力的基准测试,题目经过人工验证。

简单来说

SWE-bench Verified是一套用来测试AI编程助手修复真实存在过的软件bug能力的题库。每道题都配有真实的bug报告、需要修改的代码,以及一个用来检验修复是否正确的自动化测试——这样AI给出的答案就靠测试是否通过来评分,而不需要人一条条去读。

名字里的Verified(已验证)指的是:在原本更大的题库中,由人工重新逐一检查,筛掉那些实际上无法解决、或者描述含糊不清的题目后,留下来的精选部分。正因为经过这样的额外把关,这项测试的得分常被拿来作为衡量AI能否被信任去处理公司代码中真实bug修复工作的依据。

在报道中是这样出现的

文章中常把它当作展示新推出的智能体框架或模型实力的基准,比如:"NVIDIA表示,NOOA在SWE-bench Verified、CyberGym L1、ARC-AGI-3这三项基准测试中,相比现有的harness取得了更高的准确率和更低的token成本。"

容易被误解的一点:这项分数高,并不代表在所有编程任务上都表现出色。题目来源仅限于特定的几个开源项目,超出这个范围的实际场景中表现可能会不同。

亲手试一试

在比较编程助手时,可以参考这样提问:

这个模型的SWE-bench Verified分数是多少,在总题目中解决了多少道题?再把这个分数和其他编程助手的分数比较一下。

不要只看分数本身,同时确认一下这是基于多少道题目测出来的结果,这样有助于判断这个数字的可信度。

相关词条

出现过这个词的报道

浏览全部词条