언어·이미지 이해·이미지 생성을 한 모델에 같이 학습시킬 때 무엇이 서로 돕고 무엇이 서로 방해하는지 실험으로 밝힌 연구
언어·이미지 이해·이미지 생성을 한 모델에 같이 학습시킬 때 무엇이 서로 돕고 무엇이 서로 방해하는지 실험으로 밝힌 연구
이 연구는 텍스트, 이미지 이해, 이미지 생성을 하나의 모델에서 함께 학습시키는 '통합 멀티모달 사전학습'에서 각 능력이 서로 지식을 주고받는 방식을 통제된 실험으로 분석했다. 실제 대규모 데이터와 CLEVR 기반 합성 데이터를 모두 사용해 언어→시각, 이해→생성, 생성→이해 방향의 전이가 각각 다르게 작동함을 보였다. 이 결과를 바탕으로 데이터 비율, 구조 설계, 학습 시점에 대한 실전 레시피를 만들고 135억 파라미터 MoE 모델을 2조 토큰으로 학습해 검증했다.
METAL LAB 해설 도표
통합 멀티모달 사전학습에서 지식이 흐르는 방향
증거 상태측정 결과가 보고됨
- 언어 데이터DCLM 언어 데이터를 늘리면 이미지 이해와 이미지 생성 성능이 함께 좋아진다
- 이미지 이해 데이터이해 데이터를 늘리면 이미지 생성은 크게 좋아지지만 순수 언어 성능은 약간 떨어진다
- 이미지 생성 데이터생성 데이터를 늘려도 언어와 이해 성능에는 뚜렷한 영향 없이 소폭 변동만 있다
- CLEVR 개념 전이 실험색깔·모양은 양방향 전이 실패, 공간관계·크기·개수는 이해→생성만 성공
- 구조·시점 설계(split_ffn, 조기 통합)어텐션·정규화 공유+FFN 분리, 시각 데이터의 조기·동시 도입이 시너지를 만든다
무엇을 했나
- 언어 데이터 비율을 늘리면 이미지 이해와 이미지 생성 성능이 모두 꾸준히 좋아지는 반면, 이미지 이해 데이터를 늘리면 이미지 생성은 크게 좋아지지만 순수 언어 성능은 약간 떨어진다.
- 이미지 생성 데이터를 늘리는 것은 언어나 이미지 이해 성능에 뚜렷한 도움도 해도 주지 않고 소폭의 변동만 일으킨다.
- CLEVR 합성 데이터로 색깔·모양 같은 저수준 속성과 공간관계·크기·개수 같은 구조적 개념을 나눠 특정 개념을 한쪽 모달리티 학습에서 빼는 실험을 했더니, 색깔과 모양은 이해와 생성 사이에 전혀 전이되지 않고, 구조적 개념은 이해에서 생성 쪽으로는 전이되지만 반대 방향은 대체로 실패했다.
- 모델 구조에서 어텐션과 정규화는 공유하고 피드포워드 층만 모달리티별로 분리하면(split_ffn) 언어와 시각이 서로 방해하지 않으면서 시너지를 낼 수 있음을 확인했다.
- 시각 데이터를 처음부터 언어와 함께 학습시키는 '조기 통합'이 나중에 시각을 붙이는 방식보다 우수하며, 늦게 붙이면 모델이 시각 쪽을 충분히 최적화하지 않고 언어 지식에만 의존하는 '시각 게으름' 현상이 나타났다.
| Mix % | Language | Visual Understanding | Visual Generation | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| L | U | G | PPL ↓ | Acc ↑ | Gen ↑ | Know ↑ | OCR ↑ | V-Ctr ↑ | Avg ↑ | DPG ↑ | GenEval ↑ | CLIP-Sim ↑ | DiffLoss ↓ | |
| Fix MM | 10 | 45 | 45 | 19.27 | 41.89 | 37.9 | 26.9 | 22.9 | 42.9 | 32.7 | 0.326 | 0.148 | 0.256 | 0.2984 |
| 20 | 40 | 40 | 17.51 | 44.46 | 45.7 | 30.8 | 24.0 | 44.0 | 36.1 | 0.395 | 0.189 | 0.273 | 0.2802 | |
| 30 | 35 | 35 | 16.73 | 45.03 | 43.1 | 29.9 | 24.9 | 42.2 | 35.0 | 0.361 | 0.183 | 0.273 | 0.2826 | |
| 40 | 30 | 30 | 16.31 | 45.79 | 46.1 | 31.2 | 24.2 | 45.6 | 36.8 | 0.331 | 0.186 | 0.269 | 0.2946 | |
| 50 | 25 | 25 | 15.98 | 46.59 | 47.2 | 30.9 | 25.4 | 44.6 | 37.0 | 0.385 | 0.219 | 0.274 | 0.2804 | |
| 60 | 20 | 20 | 15.81 | 46.70 | 44.6 | 33.0 | 24.8 | 43.9 | 36.6 | 0.387 | 0.203 | 0.275 | 0.2883 | |
| 70 | 15 | 15 | 15.68 | 46.99 | 48.1 | 32.3 | 25.2 | 46.6 | 38.1 | 0.399 | 0.219 | 0.273 | 0.2996 | |
| 80 | 10 | 10 | 15.57 | 46.85 | 45.9 | 32.8 | 24.0 | 45.2 | 37.0 | 0.388 | 0.216 | 0.271 | 0.2868 | |
| 90 | 5 | 5 | 15.48 | 48.08 | 43.7 | 31.8 | 21.4 | 46.3 | 35.8 | 0.336 | 0.204 | 0.273 | 0.2894 | |
| Fix Lan | 50 | 5 | 45 | 16.05 | 45.26 | 43.8 | 29.4 | 23.7 | 43.1 | 35.0 | 0.358 | 0.206 | 0.273 | 0.2785 |
| 50 | 10 | 40 | 16.03 | 46.18 | 45.9 | 31.0 | 24.2 | 45.6 | 36.7 | 0.401 | 0.221 | 0.281 | 0.2801 | |
| 50 | 15 | 35 | 16.06 | 46.42 | 46.6 | 32.1 | 23.4 | 45.4 | 36.9 | 0.370 | 0.193 | 0.273 | 0.2834 | |
| 50 | 20 | 30 | 16.02 | 46.17 | 46.8 | 31.2 | 23.5 | 45.2 | 36.7 | 0.390 | 0.199 | 0.274 | 0.2909 | |
| 50 | 25 | 25 | 15.98 | 46.59 | 47.2 | 30.9 | 25.4 | 44.6 | 37.0 | 0.385 | 0.219 | 0.274 | 0.2804 | |
| 50 | 30 | 20 | 16.01 | 46.05 | 45.5 | 31.1 | 25.2 | 44.7 | 36.6 | 0.370 | 0.208 | 0.273 | 0.2893 | |
| 50 | 35 | 15 | 16.05 | 45.85 | 47.0 | 32.5 | 23.8 | 46.0 | 37.3 | 0.399 | 0.199 | 0.275 | 0.2821 | |
| 50 | 40 | 10 | 16.00 | 46.14 | 47.7 | 32.9 | 26.5 | 45.7 | 38.2 | 0.420 | 0.216 | 0.276 | 0.2874 | |
| 50 | 45 | 5 | 16.03 | 46.14 | 46.9 | 32.3 | 25.8 | 46.1 | 37.8 | 0.392 | 0.200 | 0.269 | 0.2931 | |
| Next | 70 | 5 | 25 | 15.67 | 46.55 | 47.0 | 32.9 | 23.9 | 43.5 | 36.8 | 0.375 | 0.204 | 0.271 | 0.2823 |
| 70 | 10 | 20 | 15.71 | 46.34 | 46.8 | 30.6 | 22.7 | 44.3 | 36.1 | 0.358 | 0.206 | 0.273 | 0.2855 | |
| 70 | 15 | 15 | 15.68 | 46.99 | 48.1 | 32.3 | 25.2 | 46.6 | 38.1 | 0.399 | 0.219 | 0.273 | 0.2996 | |
| 70 | 20 | 10 | 15.65 | 46.65 | 48.0 | 31.9 | 26.3 | 46.3 | 38.1 | 0.401 | 0.221 | 0.272 | 0.2934 | |
| 70 | 25 | 5 | 15.68 | 46.86 | 48.3 | 32.7 | 25.8 | 47.1 | 38.5 | 0.450 | 0.237 | 0.275 | 0.2868 |

| Model | Language | Visual Understanding | Visual Generation | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| PPL ↓ | Acc ↑ | Gen ↑ | Know ↑ | OCR ↑ | V-Ctr ↑ | Avg ↑ | DPG ↑ | GenEval ↑ | CLIP-Sim ↑ | DiffLoss ↓ | |
| Balanced Recipe | 11.97 | 52.86 | 51.50 | 38.90 | 25.15 | 50.14 | 41.42 | 0.676 | 0.467 | 0.310 | 0.261 |
| Dense Model | 12.14 | 52.03 | 50.12 | 36.66 | 25.43 | 49.74 | 40.49 | 0.667 | 0.459 | 0.308 | 0.266 |
| Late-Fusion | 12.25 | 51.78 | 49.89 | 37.03 | 26.22 | 49.50 | 40.66 | 0.672 | 0.471 | 0.308 | 0.269 |
| Full | 11.67 | 54.31 | 53.63 | 40.11 | 27.23 | 51.33 | 43.08 | 0.689 | 0.482 | 0.312 | 0.272 |
실제로 확인된 결과
- 언어 비율을 0%에서 80%까지 늘리자 이미지 이해의 네 축(General, Knowledge, OCR&Chart, Vision-Centric) 성능이 모두 단조 증가했고, 이미지 생성의 조건부·비조건부 확산 손실도 함께 감소했다.
- 이미지 이해 데이터 비율을 늘리면 이미지 생성 지표와 확산 손실이 크게 개선됐지만, 순수 언어 벤치마크 점수와 퍼플렉시티는 소폭 악화됐다.
- 이미지 생성 데이터를 늘려도 언어 정확도·퍼플렉시티와 이미지 이해 네 축 성능은 뚜렷한 추세 없이 소폭 변동만 보였다.
- CLEVR 실험에서 색깔·모양은 이해↔생성 어느 방향으로도 전이되지 않아 노출이 없을 때 수준으로 성능이 떨어졌고, 공간관계·크기·개수는 이해→생성 방향으로는 전이됐지만 생성→이해 방향은 개수를 제외하면 대체로 실패했다.
- 모델 구조 실험에서 어텐션·정규화 공유+FFN만 분리(split_ffn)가 완전 공유(dense)의 성능 저하를 없애면서도 시너지를 냈고, 이 시너지는 RAE, Raw Pixels, CLIP+VAE, AR(UniTok) 등 네 가지 시각 토큰화 방식 모두에서 나타났으며, 순수 언어 사전학습 구간을 늘릴수록 시각 이해·생성 성능이 꾸준히 하락했고, 동시 학습(joint training)이 순차 학습(sequential training)보다 거의 모든 지표에서 우수했다.

어디에 쓸 수 있나
- 언어, 이미지 이해, 이미지 생성을 함께 학습하는 통합 멀티모달 모델을 설계할 때 데이터 배합 비율(예: 언어 70%, 이해 25%, 생성 5%)을 정하는 참고 기준으로 활용
- 트랜스포머 구조에서 어텐션·정규화는 공유하고 피드포워드 층만 모달리티별로 분리하는 설계를 검토하는 데 참고
- 시각 데이터를 언제부터, 어떻게(순차 대 동시) 도입할지 결정하는 학습 커리큘럼 설계에 참고
한계와 남은 검증
- 주요 통제 실험은 1.5B~2.3B 규모의 자체 백본 모델과 SSTK, DCLM 등 특정 데이터셋에서 수행되어, 다른 아키텍처·데이터 구성에 그대로 적용될지는 검증되지 않았다.
- CLEVR 기반 결론은 합성 3D 장면이라는 단순화된 환경에서 나온 것이라 실제 복잡한 이미지·언어 분포에도 동일하게 적용되는지는 별도 확인이 필요하다.
- 135B 규모 검증은 13.5B MoE 모델 2조 토큰 실험 한 건으로, 더 큰 규모나 다른 모델 계열에서의 재현 여부는 추가 실험이 필요하다.
- 생성 품질 판정에 Qwen3-VL-8B-Instruct라는 또 다른 모델을 심판으로 썼기 때문에 그 판정 자체의 편향 가능성은 별도로 검증되지 않았다.
왜 중요한가
지금 여러 회사가 언어와 이미지를 한 모델에서 같이 학습시키는 통합 멀티모달 모델로 가고 있는데, 어떤 데이터 비율과 구조가 서로 도움이 되고 방해가 되는지는 그동안 경험칙에 의존해 왔다. 이 연구는 그 설계 선택을 실험으로 검증해 실전에서 쓸 수 있는 데이터 배합비와 구조 원칙을 제시한다.
이 논문의 용어
- 통합 멀티모달 사전학습 · 텍스트 생성과 이미지 이해, 이미지 생성을 하나의 모델이 처음부터 함께 학습하는 방식
- 조기 통합(Early Unification) · 학습 초반부터 시각 데이터를 언어 데이터와 함께 넣어 두 모달리티가 같이 성장하도록 하는 방식
- 시각 게으름(Vision Laziness) · 시각 데이터를 늦게 넣으면 모델이 시각 부분을 충분히 학습하지 않고 언어 지식에 의존해버리는 현상
- split_ffn · 어텐션과 정규화는 공유하되 피드포워드 신경망만 모달리티별로 따로 두는 구조 설계
- CLEVR · 색깔, 모양, 개수, 위치 등을 정확히 통제해 만들 수 있는 합성 3D 장면 데이터셋
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
METAL LAB 최신 기사
그림 출처: Junlin Han et al., arXiv:2608.05000, arxiv-nonexclusive