每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Cohere,24亿参数视觉模型"North Micro Vision"发布

专攻文档与图表理解的超小型VLM,以Apache 2.0协议在Hugging Face免费发布

이미지: METAL LAB 생성

摘要

  • Cohere发布了24亿参数级超小型视觉语言模型North Micro Vision,并以Apache 2.0许可证在Hugging Face上发布
  • 在DocVQA、ChartQA等文档与图表理解基准测试中,该模型大多超越了Gemma 4 E2B和Ministral 3 3B,但在多语言理解(MMMB)方面略逊一筹
  • 该模型具备原生分辨率处理、多轮对话、视觉定位、多语言图像理解等功能,专为文档自动化实验设计
모델명
North Micro Vision (North-Micro-Vision-Instruct)
개발사
Cohere
파라미터 규모
24억(2.4B)
라이선스
Apache 2.0
공개처
Hugging Face
공개일
2026-08-12
DocVQA 점수
0.921 (Ministral 3 3B 0.896, Gemma 4 E2B 0.732)
RefCOCO 점수
0.732 (Ministral 3 3B 0.317, Gemma 4 E2B 0.084)

读懂文档的"眼睛",变得更小了

要让计算机准确读取一张扫描合同,过去往往需要比想象中更大的模型。Cohere于8月12日发布的North Micro Vision,用一个打破这种常规认知的体积出现了。其参数量为24亿(2.4B)——在近期的开源视觉语言模型(VLM,能同时理解图像与文本的模型)中也属于最小之列。Cohere将其作为自家模型系列"North"的新成员推出,并称其为"最小的视觉语言模型"。

体积小之所以成为优势,原因在于部署成本。VLM通常需要同时搭载图像编码器和语言模型,因此比同等参数量的纯文本模型更耗内存。而2.4B级别的模型,在笔记本电脑或小型服务器上也能实现实时推理,这大大降低了想要试验文档自动化的开发者的入门门槛。

이미지: X — 프론티어랩

它能做什么

Cohere公布的功能有四项:保持原始分辨率处理图像的原生分辨率处理、围绕图像进行多轮问答的多轮对话、能够指出图像中特定区域的空间推理与视觉定位,以及多语言图像理解。Cohere强调该模型"非常适合文档理解",实际公布的基准测试结果也大多集中在这一领域。

이미지: X — 프론티어랩

从基准测试看其定位

Cohere同时公布的表格将North Micro Vision与Ministral 3 3B、LFM2.5-VL-1.6B、Phi-3.5-vision-instruct、Gemma 4 E2B、Qwen3.5-2B并列比较得分。其中Gemma 4出自Google DeepMind,Qwen3系列出自阿里巴巴通义千问(Alibaba Qwen),这些名称在我们的本体库中均已收录。

基准测试North Micro VisionMinistral 3 3BGemma 4 E2BQwen3.5-2B
DocVQA(文档理解)0.921 bar:920.896 bar:900.732 bar:730.926 bar:93
ChartQA(图表理解)0.808 bar:810.791 bar:790.422 bar:420.775 bar:78
RefCOCO(视觉定位)0.732 bar:730.317 bar:320.084 bar:80.785 bar:79
MMMB(多语言理解)0.728 bar:730.734 bar:730.743 bar:740.745 bar:75

从表格来看,Cohere的说法大体属实。North Micro Vision在文档、图表、定位等项目上,几乎全面超越了体积更大或相近的Ministral 3 3B、Gemma 4 E2B。尤其是在RefCOCO——用于衡量通过文本指令定位图像中特定物体能力的基准测试——中,该模型以巨大优势领先Gemma 4 E2B(0.084)。不过在衡量多语言图像理解能力的MMMB项目中,该模型略逊于Ministral 3 3B(0.734)和Gemma 4 E2B(0.743),在文档理解项目上也不及参数量更小的Qwen3.5-2B(0.926)。以Cohere明确列出的两个对比对象为基准,该模型确实占优,但若将表中列出的其他小型模型也纳入比较,则各项目呈现互有胜负的局面。

为何选择开源发布

Cohere近期通过其CEO艾丹·戈麦斯(Aidan Gomez)的发言,提出了开源模型所需具备的三个条件:可定制性、成本效益和可及性。此次以Apache 2.0——一种对商业使用和再分发几乎没有限制的许可证——发布North Micro Vision,也与这一方向相呼应。Cohere已将模型权重上传至Hugging Face,任何人都可以下载进行实验。

小型VLM的开源发布,是最近一个月内文因AI(Moonshot AI)等竞争对手也相继跟进的趋势。不过North Micro Vision的参数规模比这些模型小得多,更倾向于以部署便利性而非性能取胜。

这意味着什么

将扫描文档自动读取并转化为数据的工作——例如整理收据、审查合同、从图表中提取数字等——过去大多依赖大型云端API完成。如今像North Micro Vision这样24亿参数级的模型,在文档理解基准测试中取得了靠前的成绩,这意味着在本地设备上免费运行此类任务又多了一个选择。虽然其性能并非始终顶尖,但就体积与成果的比例而言,对于正在权衡实际部署方案的开发者来说,这仍具有实质性的参考价值。