Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction
텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
실제 환경에서는 음성, 영상, 텍스트 중 일부가 누락되거나 손상된 채로 들어오는 경우가 많아, 감정 분석 AI의 정확도가 떨어진다. 기존 방법들은 텍스트가 부족할 때 이를 대신할 '대리 표현'을 한 번만 만들어 바로 사용했는데, 이 초기 대리 표현이 부정확하면 오류가 뒤로 전파되는 문제가 있었다. 이 논문은 대리 표현을 한 번에 확정 짓지 않고 여러 단계에 걸쳐 점진적으로 고쳐나가는 방식을 제안해, MOSI, MOSEI, SIMS 세 데이터셋에서 기존 최고 성능 모델보다 안정적으로 더 나은 결과를 보였다.
무엇을 했나
- 문제 상황: 실제 환경에서 텍스트, 음성, 영상 중 일부 정보가 누락되거나 노이즈가 섞여 들어오면, 기존 감정 분석 모델의 예측이 흔들린다
- 기존 방식의 한계: 텍스트가 부실할 때 음성·영상 정보로 텍스트를 대신할 '대리 표현(proxy)'을 만들어 쓰는데, 이를 한 번만 만들고 바로 써버려서 초기 오류가 그대로 이어진다
- 제안 방법: 음성과 영상 정보만으로 대리 표현을 처음 만든 뒤, 게이트가 달린 잔차 보정 방식으로 여러 단계에 걸쳐 이 대리 표현을 점차 다듬는다
- 보정된 대리 표현은 실제 관찰된 텍스트 표현과, 그 텍스트가 얼마나 믿을만한지 점수를 매겨 적절한 비율로 섞어서 최종 판단에 사용한다
- 학습 시에는 손상되지 않은 완전한 텍스트 표현을 기준점으로 삼아 각 보정 단계가 올바른 방향으로 가도록 안내하는 추가 학습 목표를 사용했다
- 결과: MOSI, MOSEI, SIMS 세 벤치마크에서 기존 최고 성능 모델인 LNLN 대비 전반적으로 우수하거나 대등한 성능을 보였고, 특히 데이터가 많이 손상될수록 성능 저하가 더 완만했다
| Method | MOSI | MOSEI | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | |
| MISA | 29.85 | 33.08 | 71.49/70.00 | 71.28/70.33 | 1.085 | 0.524 | 40.84 | 39.39 | 71.27/75.82 | 63.85/68.73 | 0.780 | 0.503 |
| Self-MM | 29.55 | 34.67 | 70.51/69.26 | 66.60/67.54 | 1.070 | 0.512 | 44.70 | 45.38 | 73.89/77.42 | 68.92/72.31 | 0.695 | 0.498 |
| MMIM | 31.30 | 33.77 | 69.14/67.06 | 66.65/64.04 | 1.077 | 0.507 | 40.75 | 41.74 | 73.32/75.89 | 68.72/70.32 | 0.739 | 0.489 |
| CENET | 30.38 | 37.25 | 71.46/67.73 | 68.41/64.85 | 1.080 | 0.504 | 47.18 | 47.83 | 74.67/77.34 | 70.68/74.08 | 0.685 | 0.535 |
| TETFN | 30.30 | 34.34 | 69.76/67.68 | 65.69/63.29 | 1.087 | 0.507 | 40.30 | 47.70 | 69.76/67.68 | 65.69/63.29 | 1.087 | 0.508 |
| ALMT | 30.30 | 33.42 | 70.40/68.39 | 72.57/71.80 | 1.083 | 0.498 | 40.92 | 41.64 | 76.64/77.54 | 77.14/78.03 | 0.674 | 0.481 |
| LNLN | 34.26 | 38.27 | 72.55/70.94 | 72.73/71.25 | 1.046 | 0.527 | 45.42 | 46.17 | 76.30/78.19 | 77.77/79.95 | 0.692 | 0.530 |
| Ours | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 47.10 | 47.94 | 78.20/78.94 | 78.46/80.00 | 0.664 | 0.595 |

| Method | Acc-5 | Acc-3 | Acc-2 | F1 | MAE | Corr |
|---|---|---|---|---|---|---|
| MISA | 31.53 | 56.87 | 72.71 | 66.30 | 0.539 | 0.348 |
| Self-MM | 32.28 | 56.75 | 72.81 | 68.43 | 0.508 | 0.376 |
| MMIM | 31.81 | 52.76 | 69.86 | 66.21 | 0.544 | 0.339 |
| CENET | 22.29 | 53.17 | 68.13 | 57.90 | 0.589 | 0.107 |
| TETFN | 33.42 | 56.91 | 73.58 | 68.67 | 0.505 | 0.387 |
| ALMT | 20.00 | 45.36 | 69.66 | 72.76 | 0.561 | 0.364 |
| LNLN | 34.64 | 57.14 | 72.73 | 79.43 | 0.514 | 0.397 |
| Ours | 35.13 | 58.28 | 73.05 | 76.29 | 0.498 | 0.404 |
| Method | MOSI | MOSEI | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | |
| T | 45.58 | 51.70 | 84.91 / 82.75 | 84.84 / 82.68 | 0.731 | 0.790 | 52.39 | 53.81 | 85.75 / 84.46 | 85.7 / 84.14 | 0.548 | 0.769 |
| A | 22.84 | 23.08 | 58.49 / 57.38 | 61.27 / 59.64 | 1.371 | 0.280 | 41.38 | 41.38 | 63.84 / 71.28 | 51.85 / 59.93 | 0.830 | 0.152 |
| V | 22.98 | 24.83 | 58.59 / 56.80 | 51.78 / 53.90 | 1.376 | 0.230 | 42.46 | 42.46 | 65.30 / 71.02 | 61.06 / 58.99 | 0.811 | 0.244 |
| T+A | 45.53 | 51.31 | 85.16 / 83.19 | 84.97 / 83.07 | 0.739 | 0.790 | 52.29 | 53.68 | 85.77 / 84.65 | 85.73 / 84.20 | 0.549 | 0.764 |
| T+V | 45.40 | 51.31 | 84.86 / 82.60 | 84.70 / 82.56 | 0.737 | 0.790 | 52.48 | 53.96 | 86.08 / 84.85 | 85.99 / 84.85 | 0.545 | 0.768 |
| A+V | 22.40 | 24.30 | 59.25 / 58.31 | 56.45 / 57.04 | 1.350 | 0.198 | 42.52 | 42.52 | 65.38 / 71.22 | 60.40 / 60.12 | 0.812 | 0.244 |
| Random | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 47.10 | 47.94 | 78.20/78.94 | 78.46/80.00 | 0.664 | 0.595 |

| Method | MOSI | SIMS | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Acc-7 | Acc-5 | Acc-2 | F1 | MAE | Corr | Acc-5 | Acc-3 | Acc-2 | F1 | MAE | Corr | |
| FULL | 34.52 | 38.55 | 73.27/71.93 | 73.03/71.93 | 1.046 | 0.532 | 35.13 | 58.28 | 73.05 | 76.29 | 0.498 | 0.404 |
| w/o Proxy | 34.53 | 38.57 | 72.29 / 71.89 | 72.29 / 71.84 | 1.053 | 0.527 | 30.93 | 54.98 | 70.05 | 62.08 | 0.569 | 0.238 |
| w/o Iterative | 34.27 | 38.32 | 73.19 / 71.84 | 72.37 / 71.69 | 1.051 | 0.536 | 30.98 | 55.23 | 70.58 | 69.74 | 0.565 | 0.241 |
| w/o ℒcorr | 34.23 | 38.25 | 72.37 / 71.29 | 71.48 / 70.45 | 1.051 | 0.529 | 31.05 | 55.03 | 70.09 | 62.12 | 0.570 | 0.236 |
왜 중요한가
음성인식 오류, 통신 불안정, 사생활 보호를 위한 정보 차단 등으로 일부 정보가 빠진 채 들어오는 상황은 실제 서비스에서 흔하다. 이런 상황에서도 감정 분석이 안정적으로 작동해야 콜센터, 리뷰 분석, 대화형 AI 등에서 신뢰할 수 있는 판단을 내릴 수 있다.
이 논문의 용어
- 멀티모달 감정 분석(MSA) · 텍스트, 음성, 영상 등 여러 형태의 정보를 함께 활용해 감정 상태를 추정하는 작업
- 대리 표현(proxy) · 누락되거나 손상된 정보를 대신하기 위해 다른 정보로부터 만들어낸 보조 표현
- 게이트 잔차 보정 · 얼마나 수정할지를 조절하는 게이트와 함께, 기존 값에 수정치를 더해가며 점진적으로 고치는 방식
- 신뢰도 점수(reliability score) · 관찰된 텍스트 정보가 얼마나 믿을 만한지를 0에서 1 사이 값으로 추정한 점수
- MAE, F1, Acc · 각각 예측 오차 크기, 분류 정확도의 균형 지표, 정답을 맞춘 비율을 나타내는 평가 지표
논문 원문 초록 (영문)
Multimodal sentiment analysis aims to infer affective states by integrating language, visual, and acoustic cues. However, real-world multimodal inputs are often incomplete or corrupted, which can weaken cross-modal complementarity and introduce misleading information into downstream fusion. Existing proxy-based methods for incomplete MSA commonly rely on one-shot proxy construction to compensate for degraded language information, but the generated proxy may be coarse or unreliable at initialization. Prematurely injecting such a proxy into multimodal reasoning can propagate initial errors and compromise sentiment prediction. To address this limitation, we propose an iterative proxy correction framework for robust incomplete MSA. Our method constructs a language-oriented proxy from non-language modalities and progressively refines it under multimodal context through gated residual correction. The corrected proxy is then adaptively fused with the observed language representation according to an estimated language reliability score, allowing the model to balance proxy-based compensation and trustworthy linguistic evidence. In addition, we introduce a stage-wise latent correction objective that uses the complete language representation as a training-time semantic anchor to stabilize the proxy refinement trajectory. Extensive experiments on MOSI, MOSEI, and SIMS under diverse missing-modality settings demonstrate that the proposed framework consistently outperforms competitive baselines and achieves robust sentiment prediction under incomplete inputs.
arXiv에서 원문 보기최신 논문
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- When Saying No Makes Better Videos: Designing Dual Gatekeeping for Pedagogically Grounded AI Content CreationAI가 만든 교육 영상, 보기 좋아도 '아니오'라고 말할 수 있어야 잘 가르친다
- LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment모델을 통째로 학습하지 않고도, 학습 초반 몇 걸음의 기울기를 미리 훔쳐봐서 LoRA를 더 똑똑하게 초기화하는 법
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Natural Language Code Retrieval for 1C:Enterprise: An Open Benchmark and Efficient Bi-Encoder러시아어로 1C 회계 소프트웨어 코드를 찾아주는 첫 검색 벤치마크와 전용 AI 모델이 나왔다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection네팔어 가짜뉴스 탐지, 사진 안 보고 문장만 읽어도 정답률 94%
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
METAL LAB 최신 기사
그림 출처: Zhifa Geng et al., arXiv:2608.19971, arxiv-nonexclusive