
이미지: METAL LAB 생성
摘要
- Cohere发布了24亿参数级超小型视觉语言模型North Micro Vision,并以Apache 2.0许可证在Hugging Face上发布
- 在DocVQA、ChartQA等文档与图表理解基准测试中,该模型大多超越了Gemma 4 E2B和Ministral 3 3B,但在多语言理解(MMMB)方面略逊一筹
- 该模型具备原生分辨率处理、多轮对话、视觉定位、多语言图像理解等功能,专为文档自动化实验设计
- 모델명
- North Micro Vision (North-Micro-Vision-Instruct)
- 개발사
- Cohere
- 파라미터 규모
- 24억(2.4B)
- 라이선스
- Apache 2.0
- 공개처
- Hugging Face
- 공개일
- 2026-08-12
- DocVQA 점수
- 0.921 (Ministral 3 3B 0.896, Gemma 4 E2B 0.732)
- RefCOCO 점수
- 0.732 (Ministral 3 3B 0.317, Gemma 4 E2B 0.084)
读懂文档的"眼睛",变得更小了
要让计算机准确读取一张扫描合同,过去往往需要比想象中更大的模型。Cohere于8月12日发布的North Micro Vision,用一个打破这种常规认知的体积出现了。其参数量为24亿(2.4B)——在近期的开源视觉语言模型(VLM,能同时理解图像与文本的模型)中也属于最小之列。Cohere将其作为自家模型系列"North"的新成员推出,并称其为"最小的视觉语言模型"。
体积小之所以成为优势,原因在于部署成本。VLM通常需要同时搭载图像编码器和语言模型,因此比同等参数量的纯文本模型更耗内存。而2.4B级别的模型,在笔记本电脑或小型服务器上也能实现实时推理,这大大降低了想要试验文档自动化的开发者的入门门槛。

它能做什么
Cohere公布的功能有四项:保持原始分辨率处理图像的原生分辨率处理、围绕图像进行多轮问答的多轮对话、能够指出图像中特定区域的空间推理与视觉定位,以及多语言图像理解。Cohere强调该模型"非常适合文档理解",实际公布的基准测试结果也大多集中在这一领域。

从基准测试看其定位
Cohere同时公布的表格将North Micro Vision与Ministral 3 3B、LFM2.5-VL-1.6B、Phi-3.5-vision-instruct、Gemma 4 E2B、Qwen3.5-2B并列比较得分。其中Gemma 4出自Google DeepMind,Qwen3系列出自阿里巴巴通义千问(Alibaba Qwen),这些名称在我们的本体库中均已收录。
| 基准测试 | North Micro Vision | Ministral 3 3B | Gemma 4 E2B | Qwen3.5-2B |
|---|---|---|---|---|
| DocVQA(文档理解) | 0.921 bar:92 | 0.896 bar:90 | 0.732 bar:73 | 0.926 bar:93 |
| ChartQA(图表理解) | 0.808 bar:81 | 0.791 bar:79 | 0.422 bar:42 | 0.775 bar:78 |
| RefCOCO(视觉定位) | 0.732 bar:73 | 0.317 bar:32 | 0.084 bar:8 | 0.785 bar:79 |
| MMMB(多语言理解) | 0.728 bar:73 | 0.734 bar:73 | 0.743 bar:74 | 0.745 bar:75 |
从表格来看,Cohere的说法大体属实。North Micro Vision在文档、图表、定位等项目上,几乎全面超越了体积更大或相近的Ministral 3 3B、Gemma 4 E2B。尤其是在RefCOCO——用于衡量通过文本指令定位图像中特定物体能力的基准测试——中,该模型以巨大优势领先Gemma 4 E2B(0.084)。不过在衡量多语言图像理解能力的MMMB项目中,该模型略逊于Ministral 3 3B(0.734)和Gemma 4 E2B(0.743),在文档理解项目上也不及参数量更小的Qwen3.5-2B(0.926)。以Cohere明确列出的两个对比对象为基准,该模型确实占优,但若将表中列出的其他小型模型也纳入比较,则各项目呈现互有胜负的局面。
为何选择开源发布
Cohere近期通过其CEO艾丹·戈麦斯(Aidan Gomez)的发言,提出了开源模型所需具备的三个条件:可定制性、成本效益和可及性。此次以Apache 2.0——一种对商业使用和再分发几乎没有限制的许可证——发布North Micro Vision,也与这一方向相呼应。Cohere已将模型权重上传至Hugging Face,任何人都可以下载进行实验。
小型VLM的开源发布,是最近一个月内文因AI(Moonshot AI)等竞争对手也相继跟进的趋势。不过North Micro Vision的参数规模比这些模型小得多,更倾向于以部署便利性而非性能取胜。
这意味着什么
将扫描文档自动读取并转化为数据的工作——例如整理收据、审查合同、从图表中提取数字等——过去大多依赖大型云端API完成。如今像North Micro Vision这样24亿参数级的模型,在文档理解基准测试中取得了靠前的成绩,这意味着在本地设备上免费运行此类任务又多了一个选择。虽然其性能并非始终顶尖,但就体积与成果的比例而言,对于正在权衡实际部署方案的开发者来说,这仍具有实质性的参考价值。



