
이미지: @liquidai (X)
摘要
- Liquid AI与Artificial Analysis合作,于8月24日开源了端侧模型评测工具Pipette。
- 它不是单独评估某个模型,而是把模型、量化、运行时、设备这四项绑定成一个组合,统一测量质量、速度、延迟和内存占用。
- 首批公开数据涵盖35个模型系列、7档量化等级、llama.cpp运行时以及4种设备,共计逾万条测试结果。
- 발표
- Liquid AI 공식 X 게시물, 2026년 8월 24일 15시 11분(UTC)
- 협업
- 아티피셜 애널리시스(Artificial Analysis)와 공동 공개
- 라이선스
- 벤치마크 관리·실행·제출·채점 인프라를 Apache 2.0으로 공개
- 초기 데이터
- 검증된 결과 1만 건 이상, 성능 설정 조합 1,000개 이상
- 커버리지
- 모델 클래스 약 35종, llama.cpp 양자화 7단계, 기기 4종
- 측정 기기
- MacBook Pro(M5 Max), iPhone 17 Pro, Galaxy S26 Ultra, AMD Ryzen AI Max+ 395 + Radeon 8060S(곧 반영)
- 컨텍스트 범위
- 256~8,192 토큰, 기기 메모리가 허용하는 범위 내
- 측정 위치 분리
- 속도·메모리는 제출된 기기에서, 품질 평가는 H100에서 서버 채점
一张表,列出了在iPhone上跑完要花几秒
把模型装进iPhone 17 Pro,输入1,024个token的提示词,等它生成256个token需要多少秒、期间又占用多少内存——这样一份按模型逐一排列的表格公开了。这正是Liquid AI与Artificial Analysis于8月24日在X上发布的Pipette。
此前的基准测试平台大多是为衡量跑在云端的大模型的能力和速度而设计的。可放到手机、笔记本、PC、嵌入式硬件上的模型,情况就完全不同了——同一个模型,压缩到几比特、用什么执行引擎、装在哪块芯片上,都会让速度和分数跟着变。Pipette要做的,就是把这些条件固定下来,以可复现的方式重新测量一遍。
计量单位不是"单个模型"
在Pipette里,一条比较对象被打包成模型+量化+运行时+设备这四项组合。举例来说,"把LFM2.5-1.2B-Instruct压缩成q4_k_m格式,在llama.cpp/ios运行时上装进iPhone 17 Pro"这样一整套状态,才算作一个比较单位。
这里的量化指的是降低模型权重精度、从而压缩体积和内存占用的方法。压到4比特就能塞进手机,但准确率也会略微下降。llama.cpp是一款广泛用于在个人设备(而非服务器)上运行模型的开源执行引擎,首批公开数据的运行时全部属于这一系列。
实际打开榜单可以看到,Liquid AI自家的LFM2.5系列(230M、350M、1.2B、2.6B、8B-A1B)和Qwen3.5、gemma-4、granite-4系列,以及Llama-3.2、Ministral-3、MiniCPM5、Olmo-3、Falcon-H1R、Ornith-1.0、Nanbeige4.2等名字都混在同一个画面里。以iPhone 17 Pro屏幕为准,共有27个模型排在同一条轴线上。

首批公开内容一览
| 项目 | 首批公开内容 |
|---|---|
| 模型系列 | 约35种,来自多家厂商 |
| 量化 | llama.cpp下7个等级 |
| 运行时 | llama.cpp系列(macOS、iOS、Android) |
| 设备 | MacBook Pro(M5 Max)、iPhone 17 Pro、Galaxy S26 Ultra、AMD Ryzen AI Max+ 395 + Radeon 8060S(即将加入) |
| 上下文 | 256~8,192 token,视设备内存上限而定 |
| 结果数量 | 逾万条经验证的结果,性能配置组合超过1,000个 |
同时公开的还有六项内容:用于检索比较结果的交互式仪表盘、逾万条的公开数据集、面向macOS、Windows、iOS、Android的基准测试客户端、由Artificial Analysis负责展示综合得分的配套仪表盘、以Apache 2.0协议开放的基准测试管理/执行/提交/评分基础设施,以及可直接在设备上运行的iOS、安卓原生App。至于笔记本/台式机和手机各自能跑到哪档量化水平,原文的说法彼此略有出入,这里只能表述到"7档等级中各设备的覆盖范围有所不同"这一步。
速度在设备上测,得分在H100上评
一个值得注意的设计是,测量结构被分成了两条线:速度和内存在提交者的实体设备上测量,质量评估则放到H100服务器上跑分。这样设计是为了避免不同手机的发热、功耗条件反过来影响到正确率的评分。
公开的提交现状显示,速度/内存这一侧的提交ID有4,284个,质量评估这一侧则是303个。按运行时划分的分布如下:
| 运行时 | 记录数 | 占比 | 提交ID数 |
|---|---|---|---|
| llama.cpp:macos-arm64 | 2,430 | 45.4% | 1,944 |
| llama.cpp:ios | 1,475 | 27.5% | 1,180 |
| llama.cpp:android-arm64-v8a | 1,450 | 27.1% | 1,160 |
质量评估以llama.cpp为基准,在3个基准测试上累计了303条记录。速度数据比质量数据多出十倍不止——考虑到在设备上计时比在服务器上判卷轻量得多,这个比例其实很自然。

移动端综合得分是五项测试的简单平均
Artificial Analysis那边仪表盘展示的iPhone 17 Pro综合得分,是五项评测的简单平均值:BFCL的一部分、IFBench、AA-Omniscience、GPQA Diamond、MATH-500,上下文限制在16K token。横轴使用的E2E时间指的是处理完1,024个token的提示词、生成256个token所耗费的秒数。这个画面里,38个模型中有22个被列了出来。
图表上画着一条帕累托边界线——把"相同速度下更准确"或"相同准确率下更快"的模型连成的线。实际挑选要装进设备的候选模型时,可以优先看这条线上的点。仪表盘的说明文字也得一起读:前面看到的画面,是在q4_k_m、llama.cpp/ios、输入1,024 token、关闭思考过程这些条件下跑出的结果。条件一变,排序也会跟着变。

怎么上手用
从哪里开始——共有四条路径:Pipette仪表盘、Artificial Analysis的配套仪表盘、iOS/安卓App,以及面向macOS/Windows的客户端。各项地址都整理在Liquid AI发布推文串的第2条里。
- 打开仪表盘,在顶部的设备选择里挑出自己要部署的硬件。选iPhone 17 Pro,就只会留下在这款设备上跑出的结果。
- 用模型筛选器缩小候选范围。全部打开会一次性出现27个模型,刚开始最好先看参数规模相近的模型,更容易读。
- 切换坐标轴来看。纵轴可以设为IFBench之类的准确率,横轴可以设为E2E延迟或内存占用。
- 用Constraints按钮设定条件。量化等级和输入token长度要贴合实际部署条件,数字才有意义。
- 优先把帕累托边界线上的点挑出来作为候选,线下方的点是同等表现却更慢的组合。
- 如果想要的组合数据集里没有,就在自己的设备上跑iOS/安卓App或桌面客户端,亲自测量并提交结果。审核通过的提交会直接并入公开数据集。
- 如果想测的组合客户端还不支持,Liquid AI建议直接提交issue。
谁能使用——基础设施采用Apache 2.0协议,商用限制很少。客户端支持macOS、Windows、iOS、安卓,官方表示这套结构从第一天起就能持续添加新设备、新运行时、新模型系列和新量化等级。
能做什么——举例来说,如果一个团队想把3B级模型塞进内部App,可以先看Galaxy S26 Ultra上4比特组合的E2E秒数和内存占用,把候选缩小到两三个。如果是在做笔记本工具,可以对比MacBook Pro(M5 Max)的结果,以及即将上线的AMD Ryzen AI Max+ 395结果,借此推测Windows端的实际体验。要是遇到还没人测过的组合,直接自己跑一遍、产出第一批数据反而更快。
编辑的视角
真正挑选过端侧模型的人,一眼就能看出这次发布的价值在哪。过去要把小模型装进手机或笔记本,只能东拼西凑别人写的博客、GitHub issue里的评论、社区表格来估算。问题在于,这些数字的条件五花八门:有人用8比特测,有人用4比特测;有人在M2上测,有人在M4上测。条件不同,比较就不是比较,只是印象分。Pipette把"组合"钉死为一个计量单位,正是在方法论层面动了一刀。
把测量地点拆开也很贴合实际操作的直觉。要是在手机上把GPQA Diamond全跑一遍,一整天都耗进去了,而且越往后跑因为发热还会越来越慢。正确率这个数值本来就和设备无关,交给H100统一评一次分,设备端只测秒数和内存占用才是合理的做法。不过这套结构也有测不到的地方——"在设备上长时间运行后的性能衰减",而这恰恰是实际部署中最痛的一环。未来会不会加上持续负载测试项,是这个平台接下来要过的一道考验。
自家模型出现在自家基准测试的图表上,这一点不必戴着有色眼镜去看,但该怎么读这份数据倒是很清楚:数据集公开、第三方提交渠道开放、评分环节由不参与模型研发的独立分析机构负责——正是这三点撑起了这张表的可信度。只要其中一项打了折扣,整张表的价值也会跟着打折。读者要做的事只有一件:一定要连同屏幕说明里的条件一起看。q4_k_m、输入1,024 token、关闭思考过程——如果这些条件和自己的部署条件不一样,那一行的排序就跟自己没关系。
对国内团队来说,Galaxy S26 Ultra被纳入首批设备尤其实用——不必再靠别人的估算,就能直接确认安卓旗舰机型现实中能跑到多大规模的模型。如果正在评估端侧功能,建议在方案里写下"使用3B级模型"之前,先锁定一台目标设备,把帕累托线上的两三个组合实际跑一遍。接下来几周随着提交数据的增加,运行时列表也会从llama.cpp之外扩展开来——到那时,这张表才真正到了能用来做产品决策的阶段。




评论