每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Liquid AI发布可在3GB内运行的屏幕读取模型

LFM2.5-VL-3B,在Galaxy S26 Ultra上每秒20个token,M5 Max上228个token

LFM2.5-VL-3B 모델의 여러 항목별 성능 비교 막대그래프

이미지: X — 모델·오픈소스 화면 갈무리

摘要

  • Liquid AI在Hugging Face上发布了能够读取屏幕、文档及现实世界图像的轻量级视觉语言模型LFM2.5-VL-3B
  • 以Q4_K_M量化为准,内存占用约3GB,在苹果M5 Max上达到每秒228个token,在Galaxy S26 Ultra上为每秒20个token
  • 该公司表示,在单张H100、vLLM 0.26环境下,多图像输入首个token延迟为34毫秒,高并发状态下输出速度约为每秒11000个token
모델명
LFM2.5-VL-3B (파라미터 3.1B)
공개일·경로
2026년 8월 12일, 허깅페이스 배포
온디바이스 메모리
약 3GB (Q4_K_M 양자화 + F16 비전 프로젝터)
디코드 속도
Apple M5 Max 228 tok/s · AMD Ryzen AI Max+ 395 116 tok/s · Galaxy S26 Ultra 20 tok/s
GPU 실측 조건
NVIDIA H100 SXM5 1장, vLLM 0.26, BF16, 512² 이미지
GPU 처리량
멀티이미지 첫 토큰 34ms, 고동시성 출력 약 11K tok/s, 하루 약 10억 출력 토큰
학습 변경점
비전 사전학습 토큰 4배 확대, 어휘 사전 12만8000개로 2배 확장
벤치마크
General 평균 70.1, Multilingual 81.2 (자체 집계)

塞进3GB的"眼睛"

在一台Galaxy S26 Ultra上,一款能看图作答的模型每秒能吐出20个token。没有云端,没有账号,也不用上传。这是Liquid AI于12日发布的视觉语言模型LFM2.5-VL-3B的实测数据。该模型参数量为31亿,在4比特量化状态下内存占用约3GB。以目前中端智能手机内存普遍为8至12GB作为参照,一个能读图的模型已经缩小到可以常驻手机内部的体积。

이미지: X — 모델·오픈소스

这是一款读取什么的模型

该公司提出的用途分为三类。第一是屏幕——读取移动端、网页、桌面端的UI。第二是文档和图表中的文字与表格。第三是摄像头捕捉到的真实物体。此外还附带两项功能。一是定位(grounding)——即用坐标标出图像中特定物体的能力。由于回答的不是"这个按钮",而是"屏幕上的这个坐标",因此可以充当代替操作屏幕的智能体的"手"。另一项是工具调用,公司解释称,不仅是文本输入,图像输入也能触发函数调用。

이미지: X — 모델·오픈소스

按设备实测——与竞品模型并列比较

随附的测试表格设定为输入512×512图像和1024个文本token,输出64个token。有趣的是,该模型并非始终排名速度第一。仅看M5 Max上的解码速度,InternVL3.5-2B(260)和Qwen3.5-2B(237)更快。相反,LFM2.5-VL-3B在首个token延迟和内存占用上取得了平衡。

Apple M5 Max首个token(ms) ↓解码速度(tok/s) ↑内存(MB) ↓
LFM2.5-VL-3B2482283,257
gemma-4-E2B2711724,938
gemma-4-E4B4411117,204
InternVL3.5-2B4382602,759
Qwen3.5-4B4061265,172

手机端情况则不同。在搭载骁龙芯片的Galaxy机型(SM-S948U1)上,首个token耗时13,092毫秒,即13秒。而对比组中的InternVL3.5-4B则耗时65秒。数据表明,在手机上进行图像理解目前还不是"即时应答",而是一项"需要等待"的工作。

部署到服务器则呈现另一面

公司公布了在单张H100 SXM5、vLLM 0.26环境下实测得到的三个数字。多图像输入时首个token延迟为34毫秒——作为对比,Gemma系列约为200毫秒。在并发请求增多的区间,输出速度约为每秒11000个token,约为测试中4B级模型的两倍。此外,单张GPU每天可输出约10亿个token。这意味着小模型的价值不仅在于"能在手机上运行"。用同一块GPU处理更多请求,可以降低文档、屏幕处理流水线的单位成本。

vLLM当日支持Nemotron 3.5 Lightning…搭载三种推理加速技术

如何训练而成

该模型基于自家的LFM2.5,此次扩充了视觉部分。视觉预训练token量扩大到4倍,数据方面将图像描述、OCR、定位、指令跟随的精选数据与合成数据混合使用。分词器并未重新制作,而是在现有基础上直接扩展,词表规模翻倍达到12.8万个。这被视为其多语言得分领先的背景原因。

自评General平均分多语言
LFM2.5-VL-3B7070.181.2
LFM2-VL-3B(上一版本)6969.179.1
gemma-4-E4B-it(8B)6363.275.8
InternVL3.5 4B7069.7
Qwen3.5-4B7069.7
gemma-4-E2B-it(5.1B)5656.268.0

需要注意的是,这是厂商自行统计的数据。不过,相较于上一版本,General得分提升1.0分、多语言得分提升2.1分,这一数字体现了本次更新的幅度。

那么,发生了什么变化

迄今为止,"看屏幕点击操作的AI"大多都需要把截图上传到服务器。无论是公司内部文档还是银行App界面,很多画面都不太适合发送给外部。如果一款3GB级模型能在笔记本电脑和手机上运行,那么这些画面就有了不必外传即可处理的可能。这与今年8月9日Naver在Hugging Face上发布320亿参数级视觉语言模型HyperCLOVAX-SEED-Think-32B时的方向恰恰相反。一边是深度推理的服务器模型,这次则是快速应答的终端模型。

公司也划定了界限:该模型适用于屏幕/UI智能体、文档与图表读取、定位、多图像处理等需要快速响应的任务;如果是需要逐步推理才能解决的问题,建议通过常规的后续训练流水线来调整。该模型可直接在Hugging Face上下载。

Naver公开32B级推理型视觉语言模型SEED-Think