SWE-bench Verified
一个用来自动评分AI编程助手修复真实开源项目中实际bug能力的基准测试,题目经过人工验证。
简单来说
SWE-bench Verified是一套用来测试AI编程助手修复真实存在过的软件bug能力的题库。每道题都配有真实的bug报告、需要修改的代码,以及一个用来检验修复是否正确的自动化测试——这样AI给出的答案就靠测试是否通过来评分,而不需要人一条条去读。
名字里的Verified(已验证)指的是:在原本更大的题库中,由人工重新逐一检查,筛掉那些实际上无法解决、或者描述含糊不清的题目后,留下来的精选部分。正因为经过这样的额外把关,这项测试的得分常被拿来作为衡量AI能否被信任去处理公司代码中真实bug修复工作的依据。
在报道中是这样出现的
亲手试一试
在比较编程助手时,可以参考这样提问:
这个模型的SWE-bench Verified分数是多少,在总题目中解决了多少道题?再把这个分数和其他编程助手的分数比较一下。
不要只看分数本身,同时确认一下这是基于多少道题目测出来的结果,这样有助于判断这个数字的可信度。
