METAL LAB

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

arXiv:2608.289582026-09-01

一个5万多样本的新数据集,教多模态AI边思考边画图,而不是全用文字堆砌

CoVA-SFT是一个包含51,904个样本、涵盖222,046个逐步视觉推理轨迹的数据集,覆盖数独、国际象棋、亲属关系谜题、几何题等17项任务。用它微调的模型学会在解答纯文本推理题时构建并更新内部视觉工作区(表格、图、图表),而不是把一切都写成生硬的文字。配套的CoVA-Bench测试显示,该模型平均得分是此前同类交错视觉推理方法的两倍多,但整体上仍不及强大的纯文本推理模型。

METAL LAB 解读图

CoVA-SFT构建与评测视觉推理数据的流程

证据状态已报告实测结果

  1. 1. 理由与问答生成Claude 4.5 Sonnet说明为何该任务需要视觉工作区,并生成对应的问答对。
  2. 2. 自主渲染模型逐步生成推理过程,调用Matplotlib渲染每个视觉工作区,并将渲染图反馈回模型作为上下文。
  3. 3. 验证循环模型检查渲染图是否与题目描述结构一致,发现错误就重新绘制。
  4. 4. 微调训练用文本损失与余弦相似度视觉token损失相结合的方式,在51,904条轨迹上微调Qwen3-VL-8B-Thinking。
  5. 5. CoVA-Bench评测在17项任务、1,700个留出样本上测试,微调模型平均得分38.2%,是此前最好交错基线16.8%的两倍多。
这是 METAL LAB 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 构建了包含51,904个训练样本(CoVA-SFT)、222,046个多模态推理步骤的数据集,覆盖表格、图、布局、游戏、数学五类视觉形式与17项任务,并配套发布了1,700个留出测试样本的CoVA-Bench(每项任务100个)。
  2. 用Claude 4.5 Sonnet作为自动生成器,分三阶段运行:先说明为何需要视觉工作区并生成问答对,再用Matplotlib逐步渲染每个视觉工作区并将渲染图反馈回模型作为上下文,最后检查渲染图是否与题目结构一致,不一致就重新绘制。
  3. 对Qwen3-VL-8B-Thinking进行微调,采用双重损失:常规文本生成的交叉熵损失,加上让预测的潜在视觉token与目标视觉嵌入对齐的余弦相似度损失,使模型学会在推理过程中同步更新文字与视觉状态。
  4. 在CoVA-Bench上,微调后的模型平均得分38.2%,是此前最好的交错视觉推理基线MathCanvas(16.8%)的两倍多,并且在图推理任务上以62.0%的成绩超过了所有纯文本基线(最好的纯文本模型为57.0%)。
  5. 但在数学任务上仅得8.5%,远低于最好的纯文本基线(27.3%),原因是符号化的数学表达本就是文本模型擅长的形式,视觉token反而增加了负担而非帮助。
Figure 1: Chain of Visual Abstractions. When solv- ing text-based reasoning problems, standard textual rea- soning (left) forces models to serialize naturally visual problems into prose. In contrast, models trained on our CoVA-SFT dataset (right) learn to construct and maintain (latent) visual workspaces during the reason-
Figure 1: Chain of Visual Abstractions. When solv- ing text-based reasoning problems, standard textual rea- soning (left) forces models to serialize naturally visual problems into prose. In contrast, models trained on our CoVA-SFT dataset (right) learn to construct and maintain (latent) visual workspaces during the reason-
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 2
Table 1: Comparison with representative interleaved reasoning datasets. Prior work grounds reasoning in existing images; CoVA-SFT constructs visual workspaces from scratch for text-only inputs.
DatasetTaskInputVisual Role
Zebra-CoTVision-language reasoningMultimodalGrounded visual observations from input
Math-VRMath reasoningText & multimodalMath-specific plots and diagrams
CoVA-SFT (Ours)Text-only reasoningText-onlyVisual workspaces constructed during reasoning
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 3
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 4

研究结果

  • 用CoVA-SFT微调的模型在CoVA-Bench上平均得分38.2%,超过此前最好的交错视觉推理基线MathCanvas(16.8%)两倍以上。
  • 其他交错推理基线得分更低:CodePlot-CoT为12.9%,Zebra-CoT为11.2%,Thinking-with-Generated-Images(TwGI)几乎为零(0.9%),据报告是因为渲染错误在推理链中传播且难以纠正。
  • CoVA-SFT模型在图推理任务上超过了所有参与评测的纯文本基线(62.0% 对比最好的纯文本模型Qwen3-VL-Instruct的57.0%)。
  • 但在表格(47.2%对比最高80.3%)、布局(53.4%对比最高76.3%)、尤其数学(8.5%对比Qwen3-VL-Thinking的27.3%)任务上,不及纯文本基线。
  • 即便没有视觉辅助,纯文本模型在某些领域本身也表现不佳:Qwen3-Think在图推理上仅44.5%,在游戏类任务上仅19.3%。
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 5
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 6

可应用场景

  • 可作为训练数据和评测基准,用于构建需要在推理过程中追踪图、表、网格等空间或关系状态的多模态模型。
  • 可作为研究起点,探讨潜在视觉推理在何时有帮助、何时纯文本推理已经足够,从而指导数据集或损失函数的设计。
  • 可作为评测套件(CoVA-Bench),在同一组17项任务上比较新的文本-视觉交错推理方法。
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 7
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 8

局限与待验证事项

  • 数据集依赖上游模型(Claude 4.5 Sonnet)来生成和验证推理轨迹,尽管有自我校正循环,细微的幻觉或推理错误仍可能混入训练数据。
  • 视觉表达形式仅限于可编程渲染的静态格式(二维表格、拓扑图、布局网格、几何坐标图),尚未覆盖开放世界的空间模拟或连续机器人环境。
  • 微调后的模型整体上仍不及强大的纯文本推理基线,尤其在数学任务上明显落后,说明该方法尚不能全面替代纯文本思维链。
  • 训练和推理都带来额外计算开销:文字与视觉双重损失需要仔细调参,而涉及8个以上连续视觉状态的复杂任务在推理时需要更长的上下文和更多算力。
  • 论文报告的结果基于其自建的留出测试集CoVA-Bench,并使用LLM作为评判者(Gemini-2.5-flash)打分,尚未验证在其他基准或评判方式下的泛化能力。
CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions figure 11

为什么重要

排班、走迷宫、下棋、理清家族关系等许多推理问题本质上是视觉性的,但当前AI大多只靠大段文字来推理,处理空间或关系结构时显得笨拙。这个数据集和评测基准为研究者提供了一套具体、大规模的手段,用来训练和检验那些依靠构建并更新内部图像而非仅靠文字来推理的模型。

本文术语

  • 思维链(Chain-of-thought, CoT) · 模型在给出最终答案前,先用文字写出中间推理步骤的技巧。
  • 交错推理(Interleaved reasoning) · 将文字推理步骤与视觉步骤(图像、图表)交替混合,而不是只用文字。
  • 潜在视觉token(Latent visual tokens) · 模型内部用来代表图像的连续表示,而非真实渲染出来的图片,用于推理过程中。
  • 自主生成流水线(Agentic generation pipeline) · 由AI模型自己驱动、包含推理、渲染、检查等多个步骤的自动化数据生成过程。
  • CoVA-Bench · 与CoVA-SFT同期发布的1,700个留出测试样本,用于在相同17项任务上评测交错视觉推理能力。

无法转载的图表

  • Figure 0
  • Figure 9
  • Figure 10
在原文中查看图表 →

论文原文摘要(英文)

Chain-of-thought (CoT) reasoning has dramatically improved large language models (LLMs) by allowing them to decompose problems into intermediate steps. While CoT is widely effective for linguistic tasks, text-only CoT forces models to serialize visual problems into awkward prose. Although architectural solutions exist to process visual inputs, the community lacks a massive, multi-step, self-corrected dataset to teach models how to build and maintain internal visual workspaces when solving purely textual reasoning problems. To address this limitation, we introduce CoVA-SFT, a highly structured corpus of 51.9K samples containing over 222K multimodal reasoning steps across 5 distinct layout families and 17 complex tasks, and CoVA-Bench, a companion benchmark of 1,700 held-out test samples spanning the same tasks for reproducible evaluation. By providing explicit rationale formulations, agentic renderings, and verification loops, CoVA-SFT teaches multimodal language models to interleave text and visual abstractions. We validate the dataset by demonstrating that models fine-tuned on CoVA-SFT outperform all interleaved CoT baselines by more than 2x on average on CoVA-Bench, though they still fall short of strong text-only CoT baselines, highlighting open challenges for future work.

作者 · Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

在 arXiv 阅读

最新论文

全部论文 →

METAL LAB 最新报道

图片来源: Tsung-Han Wu et al., arXiv:2608.28958, CC BY 4.0