
요약
- Cohere가 24억 파라미터급 초소형 비전언어모델 North Micro Vision을 공개하고 허깅페이스에 아파치 2.0 라이선스로 배포했다
- DocVQA·ChartQA 등 문서·차트 이해 벤치마크에서 Gemma 4 E2B와 Ministral 3 3B를 대부분 앞섰지만 다국어 이해(MMMB)에서는 근소하게 밀렸다
- 네이티브 해상도 처리, 멀티턴 대화, 시각적 그라운딩, 다국어 이미지 이해 기능을 갖춰 문서 자동화 실험용으로 설계됐다
- 모델명
- North Micro Vision (North-Micro-Vision-Instruct)
- 개발사
- Cohere
- 파라미터 규모
- 24억(2.4B)
- 라이선스
- Apache 2.0
- 공개처
- Hugging Face
- 공개일
- 2026-08-12
- DocVQA 점수
- 0.921 (Ministral 3 3B 0.896, Gemma 4 E2B 0.732)
- RefCOCO 점수
- 0.732 (Ministral 3 3B 0.317, Gemma 4 E2B 0.084)
문서 읽는 눈, 더 작아졌다
스캔한 계약서 한 장을 컴퓨터가 제대로 읽으려면 생각보다 큰 모델이 필요했다. Cohere가 8월 12일 공개한 North Micro Vision은 그 통념을 흔드는 크기로 나왔다. 파라미터 수는 24억(2.4B) — 최근 오픈소스 비전언어모델(VLM, 이미지와 텍스트를 함께 이해하는 모델) 가운데서도 가장 작은 축에 속한다. Cohere는 이를 자사 모델 패밀리 '노스(North)'의 신규 멤버로 소개하며 "가장 작은 비전언어모델"이라고 설명했다.
작은 크기가 무기인 이유는 배치 비용이다. VLM은 통상 이미지 인코더와 언어 모델을 함께 얹기 때문에 같은 파라미터 수의 텍스트 모델보다 메모리를 더 먹는다. 2.4B급이면 노트북이나 소형 서버에서도 실시간 추론이 가능한 수준이어서, 문서 자동화를 실험해보려는 개발자에게는 진입 장벽이 크게 낮아진다.
뭘 할 수 있나
Cohere가 밝힌 기능은 네 가지다. 원본 해상도를 유지한 채 이미지를 처리하는 네이티브 해상도 처리, 이미지를 두고 여러 차례 주고받는 멀티턴 대화, 이미지 속 특정 영역을 짚어내는 공간 추론·시각적 그라운딩, 그리고 다국어 이미지 이해다. Cohere는 이 모델이 "문서 이해에 이상적"이라고 강조했는데, 실제로 공개된 벤치마크 결과도 이 지점에 몰려 있다.
벤치마크로 본 위치
Cohere가 함께 공개한 표는 North Micro Vision을 Ministral 3 3B, LFM2.5-VL-1.6B, Phi-3.5-vision-instruct, Gemma 4 E2B, Qwen3.5-2B와 나란히 놓고 점수를 비교했다. Gemma 4는 구글 딥마인드(Google DeepMind), Qwen3 계열은 알리바바 큐원(Alibaba Qwen)이 만든 모델로, 우리 온톨로지에도 등록돼 있는 이름이다.
| 벤치마크 | North Micro Vision | Ministral 3 3B | Gemma 4 E2B | Qwen3.5-2B |
|---|---|---|---|---|
| DocVQA (문서 이해) | 0.921 bar:92 | 0.896 bar:90 | 0.732 bar:73 | 0.926 bar:93 |
| ChartQA (차트 이해) | 0.808 bar:81 | 0.791 bar:79 | 0.422 bar:42 | 0.775 bar:78 |
| RefCOCO (시각적 그라운딩) | 0.732 bar:73 | 0.317 bar:32 | 0.084 bar:8 | 0.785 bar:79 |
| MMMB (다국어 이해) | 0.728 bar:73 | 0.734 bar:73 | 0.743 bar:74 | 0.745 bar:75 |
표를 보면 Cohere의 주장은 대체로 사실이다. North Micro Vision은 자신보다 크거나 비슷한 Ministral 3 3B, Gemma 4 E2B를 문서·차트·그라운딩 항목에서 거의 모두 앞섰다. 특히 RefCOCO — 이미지 속 특정 물체를 텍스트 지시로 짚어내는 능력을 재는 벤치마크 — 에서는 Gemma 4 E2B(0.084)를 큰 차이로 따돌렸다. 다만 다국어 이미지 이해를 재는 MMMB에서는 Ministral 3 3B(0.734), Gemma 4 E2B(0.743)에 근소하게 밀렸고, 문서 이해 항목에서도 자신보다 파라미터가 적은 Qwen3.5-2B(0.926)에는 못 미쳤다. Cohere가 비교 대상으로 명시한 두 모델을 기준으로 보면 우위가 맞지만, 표에 함께 오른 다른 소형 모델까지 포함하면 항목별로 엎치락뒤치락하는 구도다.

오픈소스로 푸는 이유
Cohere는 최근 자사 CEO 에이단 고메즈(Aidan Gomez)의 발언을 통해 오픈소스 모델에 필요한 조건으로 커스터마이징 가능성, 비용 효율성, 그리고 접근성을 꼽은 바 있다. North Micro Vision을 아파치 2.0 — 상업적 사용과 재배포에 제약이 거의 없는 라이선스 — 으로 공개한 것도 이 방향과 맞닿아 있다. Cohere는 가중치를 허깅페이스에 올려두고 누구나 내려받아 실험할 수 있게 했다.
소형 VLM 오픈소스 공개는 최근 한 달 사이 문샷 AI(Moonshot AI) 같은 경쟁사도 잇달아 내놓은 흐름이다. 다만 North Micro Vision은 이들보다 파라미터 규모가 훨씬 작아, 성능 대신 배치 편의성을 앞세운 쪽에 가깝다.
그래서 무엇이 달라지나
문서 스캔본을 자동으로 읽어 데이터로 바꾸는 작업 — 영수증 정리, 계약서 검토, 차트에서 숫자 뽑기 같은 업무 — 은 지금까지 대형 클라우드 API에 의존하는 경우가 많았다. North Micro Vision처럼 24억 파라미터급 모델이 문서 이해 벤치마크에서 상위권 점수를 내면서, 이런 작업을 로컬 장비에서 무료로 돌려볼 수 있는 선택지가 하나 늘었다. 성능이 항상 최상위는 아니지만, 크기 대비 결과는 실용적인 배포를 고민하는 개발자에게 실질적인 참고선이 될 만하다.





댓글