
摘要
- Liquid AI在Hugging Face上公开了能够读取屏幕、文档和真实世界图像的轻量级视觉语言模型LFM2.5-VL-3B
- 以Q4_K_M量化为基准内存约3GB,在苹果M5 Max上达到每秒228个token,在Galaxy S26 Ultra上达到每秒20个token
- 该公司表示,在单张H100、vLLM 0.26环境下,多图像首个token延迟为34毫秒,高并发输出约为每秒1.1万个token
装进3GB里的眼睛
一台Galaxy S26 Ultra看图作答,每秒吐出20个token。没有云端,没有账户,没有上传。这是Liquid AI于12日公开的视觉语言模型LFM2.5-VL-3B的实测数据。参数量为31亿个,在4比特量化状态下内存占用约为3GB。以近年来中端智能手机内存普遍为8~12GB作为感知基准,读图模型已经小到能常驻手机内部的程度。
这是一个读什么的模型
该公司提出的用途分为三类。第一是屏幕——读取移动端、网页、桌面UI。第二是文档和图表中的文字、表格。第三是摄像头捕捉到的实体物品。此外还附带两项功能。其一是定位(grounding)——即在图像中以坐标形式精确指出特定物体的能力。由于回答的不是"这个按钮",而是"屏幕上的这个坐标",因此它可以充当代替人操作屏幕的智能体之"手"。其二是工具调用,该公司表示不仅在文本输入中,在图像输入中同样也可以调用函数。

各设备实测——与竞品并列比较
附带的测试表条件是输入512×512图像和1024个文本token,输出64个token。有趣的是,它并非总是速度第一。仅看M5 Max上的解码速度,InternVL3.5-2B(260)和Qwen3.5-2B(237)更快。相反,LFM2.5-VL-3B在首个token延迟与内存占用之间取得了平衡。
| Apple M5 Max | 首个token(ms) ↓ | 解码速度(tok/s) ↑ | 内存(MB) ↓ |
|---|---|---|---|
| LFM2.5-VL-3B | 248 | 228 | 3,257 |
| gemma-4-E2B | 271 | 172 | 4,938 |
| gemma-4-E4B | 441 | 111 | 7,204 |
| InternVL3.5-2B | 438 | 260 | 2,759 |
| Qwen3.5-4B | 406 | 126 | 5,172 |
在手机上情况有所不同。在基于骁龙的Galaxy机型(SM-S948U1)上,首个token耗时13,092毫秒,即13秒。不过在对比组中,InternVL3.5-4B耗费了65秒。数据表明,在手机上进行图像理解目前还不是"即时应答",而是"需要等待"的作业。
放到服务器上则是另一番景象
在单张H100 SXM5、vLLM 0.26环境的实测中,该公司给出了三项数据。多图像输入下首个token延迟为34毫秒——作为对比基准,Gemma系列约为200毫秒。在并发请求增多的区间内,输出速度约为每秒1.1万个token,约为所测试的4B级模型的两倍。以及,单张GPU每天可处理约10亿个输出token。这是一种主张:小模型的价值不仅在于"能在手机上运行"。如果同一张GPU能处理更多请求,文档、屏幕处理流水线的单位成本就会下降。
vLLM,当日支持Nemotron 3.5 Lightning……叠加了3种推理加速

是如何训练出来的
底座是自家的LFM2.5,此次扩大了视觉方面的能力。视觉预训练token量扩大到4倍,数据混合了图像-字幕、OCR、定位、指令跟随的精选数据与合成数据。分词器没有重新制作,而是在现有基础上直接扩展,词表规模翻倍至12.8万个。这被视为其在多语言得分上领先的背景所在。
| 自测评估 | General平均 | Multilingual |
|---|---|---|
| LFM2.5-VL-3B | 70.1 | 81.2 |
| LFM2-VL-3B(上一版本) | 69.1 | 79.1 |
| gemma-4-E4B-it (8B) | 63.2 | 75.8 |
| InternVL3.5 4B | 7069.7 | – |
| Qwen3.5-4B | 7069.7 | – |
| gemma-4-E2B-it (5.1B) | 56.2 | 68.0 |
需要考虑到这是厂商自行统计的结果。不过,相较上一版本General提升1.0分、Multilingual提升2.1分的数据,也展示出此次更新的幅度。
那么改变了什么
迄今为止,"看屏幕点击的AI"大多需要将截图上传至服务器。无论是公司内部文档还是银行App界面,很多图像都不宜外传。如果3GB级模型能在笔记本电脑和手机上运行,就有可能在不将图像传出的情况下完成处理。这与今年8月9日Naver在Hugging Face上发布的320亿参数级视觉语言模型HyperCLOVAX-SEED-Think-32B的目标方向恰恰相反。一个是深度推理的服务器模型,而这次则是快速应答的端侧模型。
该公司也划出了界线:适用于屏幕/UI智能体、文档和图表读取、定位、多图像等需要快速响应的任务;而如果是需要分步骤解决的问题,则建议通过通用的后续训练流程进行调整。该模型可直接从Hugging Face下载。
Naver公开32B级推理型视觉语言模型SEED-Think





评论