Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa
문서 요약 AI 3종(BERT, RoBERTa, BART)을 같은 조건에서 직접 붙여본 결과, 글을 새로 써주는 BART가 압도적으로 앞섰다
연구진은 뉴스 기사를 요약하는 AI 모델 BERT, RoBERTa, BART를 CNN/DailyMail 뉴스 데이터셋으로 비교했다. BERT와 RoBERTa는 기사에서 중요한 문장을 그대로 골라내는 방식(추출 요약)으로 학습시켰고, BART는 이미 요약 작업에 맞게 미리 학습된 모델을 그대로 사용해 문장을 새로 생성하는 방식(생성 요약)으로 평가했다. 결과적으로 ROUGE와 BLEU라는 채점 기준에서 BART가 세 모델 중 가장 높은 점수를 받았고, RoBERTa가 BERT보다 앞섰다.
무엇을 했나
- BERT와 RoBERTa는 문장을 하나씩 고르는 '추출 요약' 방식으로 CNN/DailyMail 뉴스 데이터 15,000건으로 16번 반복 학습(파인튜닝)시켰고, BART는 이미 요약용으로 학습된 모델(BART-large-CNN)을 추가 학습 없이 그대로 사용했다.
- GPU 없이 일반 컴퓨터(CPU)만으로 실험을 진행해, 배치 크기와 학습 횟수를 줄이는 등 제한된 환경에서 결과를 얻었다.
- 평가 기준인 ROUGE-1 점수에서 BART는 약 0.4117, RoBERTa는 0.1820, BERT는 0.1485를 기록해 BART가 크게 앞섰고, 이 격차는 BLEU와 다른 ROUGE 지표에서도 비슷하게 나타났다.
- 훈련 손실(모델이 정답에 얼마나 가까워졌는지 보여주는 수치)도 RoBERTa가 1.47로 BERT의 2.11보다 낮아 더 잘 학습된 것으로 나타났다.
- BART는 문장을 새로 만들어내는 만큼 읽기 매끄럽지만 원문과 다른 숫자나 없는 내용을 슬쩍 지어내는 등 사실과 어긋나는 문제(할루시네이션)가 가끔 관찰됐고, 반대로 BERT와 RoBERTa는 원문 문장을 그대로 뽑기 때문에 사실 오류는 적지만 문장이 덜 매끄러웠다.
왜 중요한가
문서를 자동으로 요약하는 AI를 실제 업무(뉴스 요약, 보고서 정리 등)에 쓸 때 어떤 모델을 골라야 하는지 판단 근거를 제공한다. 다만 BART는 추가 학습 없이, BERT·RoBERTa는 추가 학습을 거친 상태로 비교된 것이라 점수 차이를 그대로 실력 차이로만 해석하기엔 조심할 필요가 있다.
이 논문의 용어
- BERT · 문장 앞뒤 맥락을 양방향으로 이해하도록 미리 학습된 인코더 전용 언어모델
- RoBERTa · BERT의 학습 방식을 개선해 더 많은 데이터로 더 오래 학습시킨 모델
- BART · 문장을 이해하는 인코더와 새로 생성하는 디코더를 함께 가진 모델로, 요약문을 새로 써내는 데 강함
- 추출 요약(Extractive) · 원문에 있는 문장을 그대로 골라 요약문을 만드는 방식
- 생성 요약(Abstractive) · 원문 내용을 이해한 뒤 새로운 문장으로 다시 써서 요약하는 방식
- ROUGE·BLEU · AI가 만든 요약문이 사람이 쓴 정답 요약과 얼마나 겹치는지 자동으로 점수 매기는 지표
- 할루시네이션(사실 불일치) · AI가 원문에 없는 내용이나 틀린 숫자를 그럴듯하게 지어내는 현상
논문 원문 초록 (영문)
Text summarization refers to the task of condensing a document into a shorter version while preserving its key information. Automatic text summarization (ATS), driven by advancements in natural language processing (NLP), has developed rapidly in recent years. ATS methods are commonly categorized by input type (such as single-document or multi-document summarization) and by output type (extractive, abstractive, and hybrid). This article presents a focused review of modern summarization techniques with an emphasis on transformer based models and large language models (LLMs), specifically BERT, RoBERTa and BART. It examines their architectures, pretraining strategies, and their suitability for extractive and abstractive summarization tasks.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다