
이미지: X — 모델·오픈소스 화면 갈무리
摘要
- Liquid AI在Hugging Face上发布了能够读取屏幕、文档及现实世界图像的轻量级视觉语言模型LFM2.5-VL-3B
- 以Q4_K_M量化为准,内存占用约3GB,在苹果M5 Max上达到每秒228个token,在Galaxy S26 Ultra上为每秒20个token
- 该公司表示,在单张H100、vLLM 0.26环境下,多图像输入首个token延迟为34毫秒,高并发状态下输出速度约为每秒11000个token
- 모델명
- LFM2.5-VL-3B (파라미터 3.1B)
- 공개일·경로
- 2026년 8월 12일, 허깅페이스 배포
- 온디바이스 메모리
- 약 3GB (Q4_K_M 양자화 + F16 비전 프로젝터)
- 디코드 속도
- Apple M5 Max 228 tok/s · AMD Ryzen AI Max+ 395 116 tok/s · Galaxy S26 Ultra 20 tok/s
- GPU 실측 조건
- NVIDIA H100 SXM5 1장, vLLM 0.26, BF16, 512² 이미지
- GPU 처리량
- 멀티이미지 첫 토큰 34ms, 고동시성 출력 약 11K tok/s, 하루 약 10억 출력 토큰
- 학습 변경점
- 비전 사전학습 토큰 4배 확대, 어휘 사전 12만8000개로 2배 확장
- 벤치마크
- General 평균 70.1, Multilingual 81.2 (자체 집계)
塞进3GB的"眼睛"
在一台Galaxy S26 Ultra上,一款能看图作答的模型每秒能吐出20个token。没有云端,没有账号,也不用上传。这是Liquid AI于12日发布的视觉语言模型LFM2.5-VL-3B的实测数据。该模型参数量为31亿,在4比特量化状态下内存占用约3GB。以目前中端智能手机内存普遍为8至12GB作为参照,一个能读图的模型已经缩小到可以常驻手机内部的体积。

这是一款读取什么的模型
该公司提出的用途分为三类。第一是屏幕——读取移动端、网页、桌面端的UI。第二是文档和图表中的文字与表格。第三是摄像头捕捉到的真实物体。此外还附带两项功能。一是定位(grounding)——即用坐标标出图像中特定物体的能力。由于回答的不是"这个按钮",而是"屏幕上的这个坐标",因此可以充当代替操作屏幕的智能体的"手"。另一项是工具调用,公司解释称,不仅是文本输入,图像输入也能触发函数调用。

按设备实测——与竞品模型并列比较
随附的测试表格设定为输入512×512图像和1024个文本token,输出64个token。有趣的是,该模型并非始终排名速度第一。仅看M5 Max上的解码速度,InternVL3.5-2B(260)和Qwen3.5-2B(237)更快。相反,LFM2.5-VL-3B在首个token延迟和内存占用上取得了平衡。
| Apple M5 Max | 首个token(ms) ↓ | 解码速度(tok/s) ↑ | 内存(MB) ↓ |
|---|---|---|---|
| LFM2.5-VL-3B | 248 | 228 | 3,257 |
| gemma-4-E2B | 271 | 172 | 4,938 |
| gemma-4-E4B | 441 | 111 | 7,204 |
| InternVL3.5-2B | 438 | 260 | 2,759 |
| Qwen3.5-4B | 406 | 126 | 5,172 |
手机端情况则不同。在搭载骁龙芯片的Galaxy机型(SM-S948U1)上,首个token耗时13,092毫秒,即13秒。而对比组中的InternVL3.5-4B则耗时65秒。数据表明,在手机上进行图像理解目前还不是"即时应答",而是一项"需要等待"的工作。
部署到服务器则呈现另一面
公司公布了在单张H100 SXM5、vLLM 0.26环境下实测得到的三个数字。多图像输入时首个token延迟为34毫秒——作为对比,Gemma系列约为200毫秒。在并发请求增多的区间,输出速度约为每秒11000个token,约为测试中4B级模型的两倍。此外,单张GPU每天可输出约10亿个token。这意味着小模型的价值不仅在于"能在手机上运行"。用同一块GPU处理更多请求,可以降低文档、屏幕处理流水线的单位成本。
vLLM当日支持Nemotron 3.5 Lightning…搭载三种推理加速技术
如何训练而成
该模型基于自家的LFM2.5,此次扩充了视觉部分。视觉预训练token量扩大到4倍,数据方面将图像描述、OCR、定位、指令跟随的精选数据与合成数据混合使用。分词器并未重新制作,而是在现有基础上直接扩展,词表规模翻倍达到12.8万个。这被视为其多语言得分领先的背景原因。
| 自评 | General平均分 | 多语言 |
|---|---|---|
| LFM2.5-VL-3B | 7070.1 | 81.2 |
| LFM2-VL-3B(上一版本) | 6969.1 | 79.1 |
| gemma-4-E4B-it(8B) | 6363.2 | 75.8 |
| InternVL3.5 4B | 7069.7 | – |
| Qwen3.5-4B | 7069.7 | – |
| gemma-4-E2B-it(5.1B) | 5656.2 | 68.0 |
需要注意的是,这是厂商自行统计的数据。不过,相较于上一版本,General得分提升1.0分、多语言得分提升2.1分,这一数字体现了本次更新的幅度。
那么,发生了什么变化
迄今为止,"看屏幕点击操作的AI"大多都需要把截图上传到服务器。无论是公司内部文档还是银行App界面,很多画面都不太适合发送给外部。如果一款3GB级模型能在笔记本电脑和手机上运行,那么这些画面就有了不必外传即可处理的可能。这与今年8月9日Naver在Hugging Face上发布320亿参数级视觉语言模型HyperCLOVAX-SEED-Think-32B时的方向恰恰相反。一边是深度推理的服务器模型,这次则是快速应答的终端模型。
公司也划定了界限:该模型适用于屏幕/UI智能体、文档与图表读取、定位、多图像处理等需要快速响应的任务;如果是需要逐步推理才能解决的问题,建议通过常规的后续训练流水线来调整。该模型可直接在Hugging Face上下载。


