
요약
- Liquid AI가 화면·문서·실세계 이미지를 읽는 경량 비전언어모델 LFM2.5-VL-3B를 허깅페이스에 공개했다
- Q4_K_M 양자화 기준 메모리 약 3GB로, 애플 M5 Max에서 초당 228토큰, 갤럭시 S26 울트라에서 초당 20토큰을 냈다
- H100 한 장·vLLM 0.26 환경에서는 멀티이미지 첫 토큰까지 34ms, 고동시성 출력 약 1만1000토큰/초를 기록했다고 밝혔다
- 모델명
- LFM2.5-VL-3B (파라미터 3.1B)
- 공개일·경로
- 2026년 8월 12일, 허깅페이스 배포
- 온디바이스 메모리
- 약 3GB (Q4_K_M 양자화 + F16 비전 프로젝터)
- 디코드 속도
- Apple M5 Max 228 tok/s · AMD Ryzen AI Max+ 395 116 tok/s · Galaxy S26 Ultra 20 tok/s
- GPU 실측 조건
- NVIDIA H100 SXM5 1장, vLLM 0.26, BF16, 512² 이미지
- GPU 처리량
- 멀티이미지 첫 토큰 34ms, 고동시성 출력 약 11K tok/s, 하루 약 10억 출력 토큰
- 학습 변경점
- 비전 사전학습 토큰 4배 확대, 어휘 사전 12만8000개로 2배 확장
- 벤치마크
- General 평균 70.1, Multilingual 81.2 (자체 집계)
3GB에 들어가는 눈
갤럭시 S26 울트라 한 대에서 이미지를 보고 답을 쓰는 모델이 초당 20토큰을 뱉는다. 클라우드도, 계정도, 업로드도 없다. Liquid AI가 12일 공개한 비전언어모델 LFM2.5-VL-3B의 실측치다. 파라미터는 31억 개, 4비트 양자화 상태에서 메모리 점유는 약 3GB. 요즘 중급 스마트폰 램이 8~12GB라는 점을 감각의 기준으로 삼으면, 사진을 읽는 모델 하나가 폰 안에 상주할 수 있는 크기까지 내려온 셈이다.
무엇을 읽는 모델인가
회사가 내세운 용도는 세 갈래다. 첫째는 화면 — 모바일·웹·데스크톱 UI를 읽는다. 둘째는 문서와 차트의 글자·표. 셋째는 카메라로 들어오는 실제 사물이다. 여기에 두 가지 기능이 붙는다. 하나는 그라운딩(grounding) — 이미지 안의 특정 물체를 좌표로 짚어내는 능력이다. "이 버튼"이 아니라 "화면의 이 좌표"로 답하기 때문에, 화면을 대신 조작하는 에이전트의 손 역할을 할 수 있다. 다른 하나는 도구 호출인데, 텍스트뿐 아니라 이미지 입력에서도 함수를 부를 수 있다고 회사는 설명했다.

기기별 실측 — 경쟁 모델과 나란히
첨부된 측정표는 512×512 이미지와 텍스트 1024토큰을 넣고 64토큰을 뽑는 조건이다. 흥미로운 대목은 속도 1위를 늘 차지하진 않는다는 점이다. M5 Max에서 디코드 속도만 보면 InternVL3.5-2B(260)와 Qwen3.5-2B(237)가 더 빠르다. 대신 LFM2.5-VL-3B는 첫 토큰까지 걸리는 시간과 메모리에서 균형을 잡았다.
| Apple M5 Max | 첫 토큰(ms) ↓ | 디코드(tok/s) ↑ | 메모리(MB) ↓ |
|---|---|---|---|
| LFM2.5-VL-3B | 248 | 228 | 3,257 |
| gemma-4-E2B | 271 | 172 | 4,938 |
| gemma-4-E4B | 441 | 111 | 7,204 |
| InternVL3.5-2B | 438 | 260 | 2,759 |
| Qwen3.5-4B | 406 | 126 | 5,172 |
폰에서는 사정이 다르다. 스냅드래곤 기반 갤럭시(SM-S948U1)에서 첫 토큰까지 13,092ms, 즉 13초가 걸렸다. 다만 비교군 중 InternVL3.5-4B는 65초를 썼다. 폰에서 이미지 이해는 아직 '즉답'이 아니라 '기다리는' 작업이라는 사실이 수치로 남았다.
서버에 올리면 다른 얼굴
H100 SXM5 한 장, vLLM 0.26 환경 실측으로 회사는 세 숫자를 제시했다. 멀티이미지 입력에서 첫 토큰까지 34ms — Gemma 계열이 약 200ms라는 게 비교 기준이다. 동시 요청이 많아진 구간에서 출력 약 1만1000토큰/초로, 테스트한 4B급 모델들의 대략 2배. 그리고 GPU 한 장으로 하루 약 10억 출력 토큰. 작은 모델의 가치가 '폰에서 돈다'에만 있지 않다는 주장이다. 같은 GPU로 더 많은 요청을 소화하면 문서·화면 처리 파이프라인의 단가가 내려간다.
vLLM, 넴트론 3.5 라이트닝에 당일 지원…추론 가속 3종 얹었다

어떻게 키웠나
기반은 자사 LFM2.5이고, 이번엔 시각 쪽을 늘렸다. 비전 사전학습 토큰을 4배로 키웠고, 데이터는 이미지-캡션·OCR·그라운딩·지시 따르기를 선별본과 합성본으로 섞었다. 토크나이저는 새로 만들지 않고 기존 것을 그대로 확장해 어휘를 12만8000개로 두 배 늘렸다. 다국어 점수에서 앞선 배경으로 읽힌다.
| 자체 평가 | General 평균 | Multilingual |
|---|---|---|
| LFM2.5-VL-3B | 70.1 | 81.2 |
| LFM2-VL-3B (이전 버전) | 69.1 | 79.1 |
| gemma-4-E4B-it (8B) | 63.2 | 75.8 |
| InternVL3.5 4B | 7069.7 | – |
| Qwen3.5-4B | 7069.7 | – |
| gemma-4-E2B-it (5.1B) | 56.2 | 68.0 |
제조사 자체 집계라는 점은 감안해야 한다. 다만 직전 버전 대비 General 1.0점, Multilingual 2.1점 개선이라는 수치는 이번 업데이트의 폭을 보여준다.
그래서 무엇이 달라지나
지금까지 '화면을 보고 클릭하는 AI'는 대체로 스크린샷을 서버로 올려야 했다. 사내 문서든 은행 앱 화면이든, 남에게 보내기 껄끄러운 그림이 많다. 3GB급 모델이 노트북과 폰에서 돌아간다면 그 그림을 밖으로 내보내지 않고도 처리할 여지가 생긴다. 지난 8월 9일 네이버가 320억 파라미터급 비전언어모델 HyperCLOVAX-SEED-Think-32B를 허깅페이스에 올렸을 때와는 겨냥점이 반대다. 한쪽은 깊게 추론하는 서버 모델, 이번 건은 빨리 답하는 기기 모델이다.
회사도 선을 그었다. 화면·UI 에이전트, 문서와 차트 읽기, 그라운딩, 멀티이미지처럼 빠른 응답이 필요한 일에 맞고, 단계를 밟아 풀어야 하는 문제라면 일반적인 후속학습 파이프라인으로 손을 보라는 것이다. 모델은 허깅페이스에서 바로 받을 수 있다.
네이버, 32B급 추론형 비전언어모델 SEED-Think 공개





댓글