METAL

Cohere 发布文档解析模型 Parse 5

Cohere 于 8 月 27 日发布的文档解析视觉语言模型 Parse 5 在 ParseBench 上得 79.2 分,低于 GPT-5.5 和 Opus 4.8。公司自己公开了这张表,转而主打吞吐量和成本:8 张 H100 上每分钟 2,160 页。

Cohere 发布文档解析模型 Parse 5

图片:METAL

摘要

  • Cohere 于 8 月 27 日发布文档解析视觉语言模型 Parse 5,并在 9 月 14 日于 X 上发布了一段宣传短片。
  • ParseBench 三项平均 79.2 分,低于 GPT-5.5(84.4)、Opus 4.8(84.3)和 Gemini 3.5 Flash(81.8),高于 Mistral OCR 4(74.5)和 AWS Textract(53.3)。
  • 这个 23 亿参数的模型在 8 张 H100 的节点上每分钟处理 2,160 页,公司称部署在 Model Vault 上比 API 最多可降低 61% 的推理成本。

Cohere 于 9 月 14 日在 X 上发布了一段 5 秒短片。全部内容只有一句话:"你在文档解析上花的钱太多了。Cohere Parse 5 来解决这个问题。"这句话指向的产品是 8 月 27 日发布的文档解析模型 Parse 5,而公司公告从第一行到最后一条脚注,就是把这一句话用数字展开的文件。这是一次公司先承认自己不是精度第一、转而把价格摆在前面的发布。

Parse 5 是一个视觉语言模型,按页接收 PDF、幻灯片和扫描图像,返回保留结构的 Markdown。它不像只认字的 OCR,而是能识别表格、表单、图表和嵌入图片,并给表格和图片附上位置坐标,也就是边界框,让检索系统或智能体可以回溯内容来自原文的哪个位置。公司说这种输出是文档索引、RAG 和智能体检索的基础。支持九种语言,据报道分别是阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语。

工程师首先会注意到的是体量。据报道,这个模型有 23 亿参数,建立在 Cohere Labs 的 North Micro Vision Instruct 架构之上,上下文窗口为 8,192 个 token,体积约 4.6GB。一个 4 亿参数的视觉编码器以原始分辨率读取页面,用二维旋转位置嵌入保持空间结构,一个 20 亿参数的语言模型接收这些特征,按阅读顺序写出 Markdown。页面图像输入、模型单次通过、Markdown 输出,这样的结构把先跑 OCR 再用另一个模型整理的两步流水线折叠成了一步。METAL 曾报道这个基础模型 North Micro Vision 以 24 亿参数视觉模型的形式公开。

分数以表格形式放在公告里。在文档解析基准 ParseBench 的三项平均中,Parse 5 得 79.2 分:表格提取 87.0,内容忠实度 86.6,语义格式 64.0。同一张表里,GPT-5.5 的 84.4、Opus 4.8 的 84.3、Gemini 3.5 Flash 的 81.8 都排在 Parse 5 之上,公司写道这三者都是通用的、比 Parse 大得多的前沿模型。往下是 LlamaParse 的经济型 78.3、开放权重的 Chandra OCR 2 77.7、Mistral OCR 4 74.5、Databricks AI Parse 72.4、Azure Document Intelligence 69.3,Google Document AI 为 57.3,AWS Textract 为 53.3。公司强调,与两家超大规模云服务商的差距超过 20 分。

表里也有空缺的格子。据公告脚注,ParseBench 的版面和图表两项被排除在比较之外:版面项衡量给每个文字元素画边界框的能力,而这个模型的设计只给表格和图片加坐标;图表项衡量从图形中提取数值数据的能力,而这个模型把图表当作带说明文字的视觉元素来处理。公司表示图表数据提取已列入下一版本计划。同一条脚注还写道,截至 2026 年 8 月的评分规则修正了粗体和标题检测的错误,此前语义格式分数被抬高了,所有竞争模型也都按新规则重新评分。

据报道,Cohere AI 搜索副总裁 Nils Reimers 在采访中说:"文档解析之所以没有被解决,是因为难点不在于读取文字,而在于保留结构和含义。"他解释说,企业文档混杂着会改变数据解释的表格、图示、图表和格式,大多数工具要么丢掉结构,要么编造内容,即便是前沿模型在版面复杂的页面上也会出错。关于为什么不把图表提取成数据,他说:"其他方案试图从图表中提取数据,但这样会漏掉关键信息(比如线条的颜色或样式),在聊天和智能体应用中导致幻觉。"

速度和成本才是这次发布的正题。据公告,Parse 5 在单张 GPU 上每秒处理 4.5 页,在 8 张 H100 的节点上每秒 36 页,即每分钟 2,160 页。在相同 GPU 配置下,它比 RedNote 的 dots.mocr 快 1.4 倍,比 Chandra OCR 2 快 2.2 倍,比较全部在用 vLLM 提供服务的开源模型之间进行。它可以通过 Cohere API 使用,也可以部署到单租户托管推理平台 Model Vault 上,公司写道在 GPU 利用率 50% 时 Model Vault 比 API 降低 23% 的推理成本,利用率打满时降幅可达 61%。公司举例的规模是每月处理 1,300 万页的大型企业应付账款工作流。

据报道,Reimers 副总裁说,他们测算了一个每年处理 7.5 亿份文档的大型金融机构工作流,如果选择 Parse 5 而不是 GPT-5.5 这样的大型通用模型,成本可降低 98% 以上。这个数字不是实际部署的成绩,而是 Cohere 针对单个工作流建模得出的估算。打个比方,让前沿模型去读几百万张发票,就像让会计去分拣邮件;Parse 5 的提议是在那个位置上安排一名专职分拣员。会计读得更准这一事实,则原样留在表里。

外界的目光越过基准分数,看向下一步。据报道,HyperFRAME Research 的 AI 技术栈业务负责人 Stephanie Walter 说:"它不需要赢下每一个基准测试。它需要做的是让可靠的企业级解析变得经济。"她指出,解析是企业 AI 技术栈的第一道质量关口,如果表格、标题、图片和阅读顺序在摄取阶段丢失,更好的嵌入或更大的模型也无法把结构找回来。BARC US 研究副总裁 Kevin Petrie 在同一篇报道中表示,其机构正在完成的一项调查显示,文档分析是采用率第一的 AI 用途,受访组织中有 62% 已经采用。

METAL 核对过的公告也引用了 ParseBench 的构成,据报道,这个基准由保险、金融和政府文档中经人工核对的 2,000 多页组成。同一篇报道指出,在 ParseBench 完整排行榜上,LlamaParse 的 Agentic Plus 配置以 90.20 分领先,而进入 Cohere 表格的是该公司的经济型配置。这就是为什么读公告表格时,要一并看清各家公司送上来的是哪个档次的产品。

部署路径有四条。可以立即通过 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 使用;在搜索技术栈 Compass 里,它与嵌入模型 Embed、重排序模型 Rerank 打包在一起,从文档摄取、解析、分块、索引到混合搜索都在一个界面里运转。受监管行业的团队可以把它部署到自己的基础设施上,公告也邀请读者先在免费的 Space 里用自己的文档试一试。METAL 曾报道Cohere 首席执行官 Aidan Gomez 就 AI 规则该由谁来定发表了文章,这家公司强调私有云和本地部署的路线,也原样延续到了这款产品的交付方式上。

这是一次公司自己公开精度表上输掉的那几行、再在旁边立起吞吐量和成本表的发布。能把每一页都交给前沿模型的组织很少,在处理几百万页的工作流里,胜负不在 5 分的分差,而在每页成本和每秒页数。Cohere 把这笔账写进了公告,9 月 14 日那段 5 秒短片,就是把这笔账压缩成一句话的广告。

评论