Pipette
一款开源基准测试工具,用于测量AI模型在手机、笔记本等个人设备上的响应速度和内存占用
简单来说
Pipette是一款工具,能精确测量AI模型在手机或笔记本等个人设备上生成答案的速度以及占用的内存量。这个名字来源于实验室中用来精准移取液体的移液器,寓意是在完全相同的条件下,逐一精确测试多个模型。
此前的大多数性能对比表都是围绕测量部署在服务器上的大模型设计的。但即使是同一个模型,压缩程度、运行时环境、部署设备的不同都会让速度和准确率产生很大差异。Pipette把模型、量化程度、运行时、设备这四个要素捆绑成一个统一的比较单位,让人们能够在相同条件下并排比较多种组合。
该工具由Liquid AI与Artificial Analysis共同发布,采用分工测量的方式:在iPhone、Galaxy等真实设备上直接测量延迟和内存占用,而答案质量则在独立的服务器上评分。
在报道中是这样出现的
文章中会这样写道:"在Pipette中,一个比较单位被定义为模型+量化+运行时+设备。"这里容易被误解的一点是,Pipette并不是单一模型,而是集仪表盘、数据集、基准测试客户端和评分基础设施于一体的工具组合。
亲手试一试
在Pipette仪表盘上选择一款你感兴趣的设备(比如iPhone或Galaxy级别的智能手机),再选两个大小不同的模型,并排比较它们的响应耗时和内存占用。也可以尝试对同一模型改变量化程度,观察速度和内存占用如何变化。
