52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다
52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다
CoVA-SFT는 스도쿠, 체스, 가족관계 퍼즐, 기하 문제 등 17가지 과제에 걸쳐 222,046개의 시각적 추론 단계를 담은 51,904개 샘플 데이터셋이다. 이 데이터로 파인튜닝한 모델은 순수 텍스트로 모든 걸 서술하는 대신 표, 그래프, 도형 같은 내부 시각 작업공간을 만들고 갱신하며 문제를 푼다. 함께 공개한 CoVA-Bench 평가에서 이 모델은 기존 인터리브 시각 추론 기법들의 평균 점수를 두 배 이상 앞섰지만, 전체적으로는 여전히 강력한 텍스트 전용 추론 모델에는 못 미쳤다.
METAL LAB 해설 도표
무엇을 했나
- 표, 그래프, 레이아웃, 게임, 수학 다섯 가지 시각 유형과 17개 과제에 걸쳐 222,046개의 멀티모달 추론 단계를 담은 51,904개 학습 샘플(CoVA-SFT)과 과제당 100개씩 총 1,700개의 held-out 테스트셋(CoVA-Bench)을 구축했다.
- Claude 4.5 Sonnet을 자동 생성기로 써서 3단계 파이프라인을 돌렸다: 왜 시각 작업공간이 필요한지 설명하고 질문-답을 만든 뒤, Matplotlib으로 단계별 시각 작업공간을 렌더링해 그 이미지를 다시 맥락으로 넣고, 마지막으로 문제와 이미지가 구조적으로 맞는지 검증해 틀리면 다시 그리는 자기 교정 루프를 돌렸다.
- Qwen3-VL-8B-Thinking을 텍스트용 크로스엔트로피 손실과, 예측한 잠재 시각 토큰을 정답 시각 임베딩에 맞추는 코사인 유사도 손실을 함께 쓰는 이중 목적 함수로 파인튜닝해, 텍스트와 시각 상태를 동시에 갱신하도록 학습시켰다.
- CoVA-Bench에서 이 모델은 평균 38.2%를 기록해, 차선의 인터리브 시각 추론 기준선인 MathCanvas(16.8%)를 두 배 이상 앞섰고, 그래프 추론에서는 텍스트 전용 최고 모델(57.0%)보다 높은 62.0%를 기록해 텍스트 전용 모델들을 모두 이겼다.
- 반면 수학 과제에서는 8.5%에 그쳐 텍스트 전용 최고 기준선(27.3%)에 크게 못 미쳤는데, 수식 표기가 이미 텍스트 모델에 익숙한 형태라 시각 토큰이 오히려 부담이 된 것으로 분석됐다.


| Dataset | Task | Input | Visual Role |
|---|---|---|---|
| Zebra-CoT | Vision-language reasoning | Multimodal | Grounded visual observations from input |
| Math-VR | Math reasoning | Text & multimodal | Math-specific plots and diagrams |
| CoVA-SFT (Ours) | Text-only reasoning | Text-only | Visual workspaces constructed during reasoning |


실제로 확인된 결과
- CoVA-SFT로 학습한 모델은 CoVA-Bench에서 평균 38.2%를 기록해, 기존 인터리브 시각 추론 기준선 중 최고인 MathCanvas(16.8%)를 두 배 이상 앞섰다.
- 다른 인터리브 기준선들은 훨씬 낮았다: CodePlot-CoT 12.9%, Zebra-CoT 11.2%, Thinking-with-Generated-Images(TwGI)는 거의 0%(0.9%)로, 렌더링 오류가 추론 과정에 그대로 이어져 회복되지 못한 것으로 보고됐다.
- CoVA-SFT 모델은 그래프 추론에서 평가된 모든 텍스트 전용 기준선을 앞질렀다(62.0% 대 텍스트 전용 최고 모델 Qwen3-VL-Instruct의 57.0%).
- 반면 표(47.2% 대 최고 80.3%), 레이아웃(53.4% 대 최고 76.3%), 특히 수학(8.5% 대 Qwen3-VL-Thinking의 27.3%)에서는 텍스트 전용 기준선에 뒤졌다.
- 텍스트 전용 모델들도 시각적 보조 없이 특정 영역에서는 어려움을 겪었다: Qwen3-Think는 그래프에서 44.5%, 게임 과제에서 19.3%에 그쳤다.


어디에 쓸 수 있나
- 추론 중 그래프, 표, 격자 같은 공간적·관계적 상태를 추적해야 하는 멀티모달 모델을 만들 때 쓸 학습 데이터와 평가 기준으로 활용할 수 있다.
- 잠재 시각 추론이 언제 도움이 되고 언제 순수 텍스트 추론이 이미 충분한지 연구하는 출발점으로 활용해 데이터셋이나 목적 함수 설계에 참고할 수 있다.
- 17개 과제에 걸친 공통 평가 세트(CoVA-Bench)로 새로운 텍스트-시각 인터리브 추론 기법들을 비교하는 평가 도구로 쓸 수 있다.


한계와 남은 검증
- 데이터셋 생성과 검증을 상위 모델(Claude 4.5 Sonnet)에 의존하기 때문에, 자기 교정 루프가 있어도 미묘한 환각이나 추론 오류가 학습 데이터에 섞여 들어갈 수 있다.
- 시각 표현이 프로그램으로 렌더링 가능한 정적 형식(2D 표, 그래프, 레이아웃 격자, 기하 도형)에 한정되어 있어, 개방형 공간 시뮬레이션이나 연속적인 로봇 환경은 다루지 않는다.
- 파인튜닝한 모델은 전체적으로 여전히 강력한 텍스트 전용 추론 기준선에 못 미치며, 특히 수학 과제에서 뚜렷이 뒤처져 아직 텍스트 전용 CoT를 완전히 대체할 수 있는 단계는 아니다.
- 학습과 추론 모두 추가 연산 비용이 든다. 텍스트와 시각 손실을 함께 최적화하려면 세심한 하이퍼파라미터 튜닝이 필요하고, 시각 상태가 8단계 이상 이어지는 복잡한 과제는 추론 시 더 긴 컨텍스트와 더 많은 연산을 요구한다.
- 보고된 결과는 논문 자체의 held-out 벤치마크 CoVA-Bench에서 LLM 심판(Gemini-2.5-flash)을 사용해 평가한 것으로, 다른 벤치마크나 평가 방식에 대한 일반화는 아직 확인되지 않았다.

왜 중요한가
일정 짜기, 미로, 체스, 가족관계처럼 본래 시각적인 문제가 많은데도 지금의 AI는 대부분 긴 텍스트로만 추론해 공간·관계 구조를 다루기 번거롭다. 이 데이터셋과 벤치마크는 모델이 말로만 풀지 않고 내부 이미지를 만들고 갱신하며 추론하도록 훈련·평가할 수 있는 구체적이고 대규모의 수단을 연구자들에게 제공한다.
이 논문의 용어
- Chain-of-thought(CoT) · 모델이 최종 답을 내기 전에 중간 추론 과정을 텍스트로 풀어 쓰는 방식.
- 인터리브 추론(Interleaved reasoning) · 텍스트 단계와 시각 단계(이미지, 도표)를 번갈아 섞어가며 추론하는 방식.
- 잠재 시각 토큰(Latent visual tokens) · 실제로 렌더링한 그림 대신 모델 내부에서 이미지를 대신하는 연속적인 표현.
- 에이전틱 생성 파이프라인 · AI 모델이 스스로 추론, 렌더링, 검증까지 여러 단계를 이끌며 데이터를 만드는 자동화 과정.
- CoVA-Bench · CoVA-SFT와 같은 17개 과제에서 인터리브 시각 추론 능력을 재기 위해 함께 공개한 1,700개 held-out 테스트셋.
본문에 싣지 못한 그림
- Figure 0
- Figure 9
- Figure 10
최신 논문
- AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀
- 886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다
- 컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다
- AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다
- AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다
- 챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구
- 중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다중앙 지휘자 없이 AI 에이전트들이 자기들끼리 협업해서 수학 난제 5개에서 새로운 결과를 냈다
- LLM 에이전트의 실행 기록 수천 개를 상태 7~43개짜리 작은 오토마톤 하나로 압축해, 다음 행동 예측과 실패 예측을 동시에 해내는 방법LLM 에이전트의 실행 기록 수천 개를 상태 7~43개짜리 작은 오토마톤 하나로 압축해, 다음 행동 예측과 실패 예측을 동시에 해내는 방법
METAL LAB 최신 기사
그림 출처: Tsung-Han Wu et al., arXiv:2608.28958, CC BY 4.0
