ParseBench-100
用100项任务衡量AI读取文档中文字和表格准确度的测试
简单来说
文档解析基准测试(ParseBench-100)是衡量AI读取扫描文档或图像中文字能力的一种测试。就像人用眼睛阅读文件一样,给AI一份文档,评判它能否准确提取其中的文字和表格。
即使是同一项测试,如果围绕AI的执行框架不同,得分也可能相差很大。比如是否把文档切成小块来读、是否把表格和图片分开处理,这些设计上的差异都会直接体现在分数上。这项测试也曾被用来检验文档是否完全在设备本地处理、而不会外传。
在报道中是这样出现的
文章提到:“在测试文档阅读能力的ParseBench-100中,便携式电脑得分65.1%,大幅领先Hermes(34.6%)和Pi(13.9%),整个过程都在设备本地完成,文档不会外传。”这里容易产生的误解是,以为分数差异就是AI模型本身性能的差异,但实际上,即便是同一个模型,围绕它设计的执行框架不同,得分也可能大相径庭。
