METAL LAB

52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다

arXiv:2608.289582026-09-01

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다

CoVA-SFT는 스도쿠, 체스, 가족관계 퍼즐, 기하 문제 등 17가지 과제에 걸쳐 222,046개의 시각적 추론 단계를 담은 51,904개 샘플 데이터셋이다. 이 데이터로 파인튜닝한 모델은 순수 텍스트로 모든 걸 서술하는 대신 표, 그래프, 도형 같은 내부 시각 작업공간을 만들고 갱신하며 문제를 푼다. 함께 공개한 CoVA-Bench 평가에서 이 모델은 기존 인터리브 시각 추론 기법들의 평균 점수를 두 배 이상 앞섰지만, 전체적으로는 여전히 강력한 텍스트 전용 추론 모델에는 못 미쳤다.

METAL LAB 해설 도표

표·그래프·게임 등 17개 과제 문제들이 Claude의 자기교정 루프를 거쳐 단계별 시각 작업공간으로 렌더링된다. 이 데이터로 텍스트 손실과 시각 손실을 함께 쓰는 이중목적 학습을 거친 모델은, 그래프 과제에서는 텍스트 전용 모델을 이겼지만 수학을 비롯한 다른 과제에서는 여전히 뒤처지는 절반의 성공을 거두었다.
METAL LAB이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 표, 그래프, 레이아웃, 게임, 수학 다섯 가지 시각 유형과 17개 과제에 걸쳐 222,046개의 멀티모달 추론 단계를 담은 51,904개 학습 샘플(CoVA-SFT)과 과제당 100개씩 총 1,700개의 held-out 테스트셋(CoVA-Bench)을 구축했다.
  2. Claude 4.5 Sonnet을 자동 생성기로 써서 3단계 파이프라인을 돌렸다: 왜 시각 작업공간이 필요한지 설명하고 질문-답을 만든 뒤, Matplotlib으로 단계별 시각 작업공간을 렌더링해 그 이미지를 다시 맥락으로 넣고, 마지막으로 문제와 이미지가 구조적으로 맞는지 검증해 틀리면 다시 그리는 자기 교정 루프를 돌렸다.
  3. Qwen3-VL-8B-Thinking을 텍스트용 크로스엔트로피 손실과, 예측한 잠재 시각 토큰을 정답 시각 임베딩에 맞추는 코사인 유사도 손실을 함께 쓰는 이중 목적 함수로 파인튜닝해, 텍스트와 시각 상태를 동시에 갱신하도록 학습시켰다.
  4. CoVA-Bench에서 이 모델은 평균 38.2%를 기록해, 차선의 인터리브 시각 추론 기준선인 MathCanvas(16.8%)를 두 배 이상 앞섰고, 그래프 추론에서는 텍스트 전용 최고 모델(57.0%)보다 높은 62.0%를 기록해 텍스트 전용 모델들을 모두 이겼다.
  5. 반면 수학 과제에서는 8.5%에 그쳐 텍스트 전용 최고 기준선(27.3%)에 크게 못 미쳤는데, 수식 표기가 이미 텍스트 모델에 익숙한 형태라 시각 토큰이 오히려 부담이 된 것으로 분석됐다.
Figure 1: Chain of Visual Abstractions. When solv- ing text-based reasoning problems, standard textual rea- soning (left) forces models to serialize naturally visual problems into prose. In contrast, models trained on our CoVA-SFT dataset (right) learn to construct and maintain (latent) visual workspaces during the reason-
Figure 1: Chain of Visual Abstractions. When solv- ing text-based reasoning problems, standard textual rea- soning (left) forces models to serialize naturally visual problems into prose. In contrast, models trained on our CoVA-SFT dataset (right) learn to construct and maintain (latent) visual workspaces during the reason-
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 2
Table 1: Comparison with representative interleaved reasoning datasets. Prior work grounds reasoning in existing images; CoVA-SFT constructs visual workspaces from scratch for text-only inputs.
DatasetTaskInputVisual Role
Zebra-CoTVision-language reasoningMultimodalGrounded visual observations from input
Math-VRMath reasoningText & multimodalMath-specific plots and diagrams
CoVA-SFT (Ours)Text-only reasoningText-onlyVisual workspaces constructed during reasoning
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 3
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 4

실제로 확인된 결과

  • CoVA-SFT로 학습한 모델은 CoVA-Bench에서 평균 38.2%를 기록해, 기존 인터리브 시각 추론 기준선 중 최고인 MathCanvas(16.8%)를 두 배 이상 앞섰다.
  • 다른 인터리브 기준선들은 훨씬 낮았다: CodePlot-CoT 12.9%, Zebra-CoT 11.2%, Thinking-with-Generated-Images(TwGI)는 거의 0%(0.9%)로, 렌더링 오류가 추론 과정에 그대로 이어져 회복되지 못한 것으로 보고됐다.
  • CoVA-SFT 모델은 그래프 추론에서 평가된 모든 텍스트 전용 기준선을 앞질렀다(62.0% 대 텍스트 전용 최고 모델 Qwen3-VL-Instruct의 57.0%).
  • 반면 표(47.2% 대 최고 80.3%), 레이아웃(53.4% 대 최고 76.3%), 특히 수학(8.5% 대 Qwen3-VL-Thinking의 27.3%)에서는 텍스트 전용 기준선에 뒤졌다.
  • 텍스트 전용 모델들도 시각적 보조 없이 특정 영역에서는 어려움을 겪었다: Qwen3-Think는 그래프에서 44.5%, 게임 과제에서 19.3%에 그쳤다.
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 5
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 6

어디에 쓸 수 있나

  • 추론 중 그래프, 표, 격자 같은 공간적·관계적 상태를 추적해야 하는 멀티모달 모델을 만들 때 쓸 학습 데이터와 평가 기준으로 활용할 수 있다.
  • 잠재 시각 추론이 언제 도움이 되고 언제 순수 텍스트 추론이 이미 충분한지 연구하는 출발점으로 활용해 데이터셋이나 목적 함수 설계에 참고할 수 있다.
  • 17개 과제에 걸친 공통 평가 세트(CoVA-Bench)로 새로운 텍스트-시각 인터리브 추론 기법들을 비교하는 평가 도구로 쓸 수 있다.
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 7
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 8

한계와 남은 검증

  • 데이터셋 생성과 검증을 상위 모델(Claude 4.5 Sonnet)에 의존하기 때문에, 자기 교정 루프가 있어도 미묘한 환각이나 추론 오류가 학습 데이터에 섞여 들어갈 수 있다.
  • 시각 표현이 프로그램으로 렌더링 가능한 정적 형식(2D 표, 그래프, 레이아웃 격자, 기하 도형)에 한정되어 있어, 개방형 공간 시뮬레이션이나 연속적인 로봇 환경은 다루지 않는다.
  • 파인튜닝한 모델은 전체적으로 여전히 강력한 텍스트 전용 추론 기준선에 못 미치며, 특히 수학 과제에서 뚜렷이 뒤처져 아직 텍스트 전용 CoT를 완전히 대체할 수 있는 단계는 아니다.
  • 학습과 추론 모두 추가 연산 비용이 든다. 텍스트와 시각 손실을 함께 최적화하려면 세심한 하이퍼파라미터 튜닝이 필요하고, 시각 상태가 8단계 이상 이어지는 복잡한 과제는 추론 시 더 긴 컨텍스트와 더 많은 연산을 요구한다.
  • 보고된 결과는 논문 자체의 held-out 벤치마크 CoVA-Bench에서 LLM 심판(Gemini-2.5-flash)을 사용해 평가한 것으로, 다른 벤치마크나 평가 방식에 대한 일반화는 아직 확인되지 않았다.
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다 figure 11

왜 중요한가

일정 짜기, 미로, 체스, 가족관계처럼 본래 시각적인 문제가 많은데도 지금의 AI는 대부분 긴 텍스트로만 추론해 공간·관계 구조를 다루기 번거롭다. 이 데이터셋과 벤치마크는 모델이 말로만 풀지 않고 내부 이미지를 만들고 갱신하며 추론하도록 훈련·평가할 수 있는 구체적이고 대규모의 수단을 연구자들에게 제공한다.

이 논문의 용어

  • Chain-of-thought(CoT) · 모델이 최종 답을 내기 전에 중간 추론 과정을 텍스트로 풀어 쓰는 방식.
  • 인터리브 추론(Interleaved reasoning) · 텍스트 단계와 시각 단계(이미지, 도표)를 번갈아 섞어가며 추론하는 방식.
  • 잠재 시각 토큰(Latent visual tokens) · 실제로 렌더링한 그림 대신 모델 내부에서 이미지를 대신하는 연속적인 표현.
  • 에이전틱 생성 파이프라인 · AI 모델이 스스로 추론, 렌더링, 검증까지 여러 단계를 이끌며 데이터를 만드는 자동화 과정.
  • CoVA-Bench · CoVA-SFT와 같은 17개 과제에서 인터리브 시각 추론 능력을 재기 위해 함께 공개한 1,700개 held-out 테스트셋.

본문에 싣지 못한 그림

  • Figure 0
  • Figure 9
  • Figure 10
원문에서 그림 보기 →

저자 · Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL LAB 최신 기사

그림 출처: Tsung-Han Wu et al., arXiv:2608.28958, CC BY 4.0