Reliable Financial Named Entity Recognition under Domain Shift
금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
금융 문서(SEC 신고서)로 학습시킨 개체명 인식 AI를 뉴스, 소셜미디어로 옮겨 테스트하니 정확도뿐 아니라 AI가 스스로 매기는 확신도(신뢰도)까지 무너졌다. 특히 문장 전체 확률로 매긴 자신감은 도메인이 바뀌면 믿을 수 없게 되고, 개체명 부분만 본 확률이나 같은 입력을 여러 번 생성해 일치하는 정도(자기일관성)가 더 안정적이었다. 다만 소셜미디어처럼 아주 다른 도메인에서는 어떤 신뢰도 지표도 안전하게 자동 처리할 문장을 골라내지 못했다.
무엇을 했나
- SEC 신고서로 학습한 BERT 태거와 소형 언어모델(Qwen2.5 0.5B/1.5B, LoRA로 미세조정)을 신고서-금융뉴스-일반 트위터 3단계로 테스트
- 다섯 가지 추론 시점 신뢰도 신호(문장 전체 확률, 토큰 확률, 개체명 확률, 유형 확률, 자기일관성)를 비교하고 3개 시드와 부트스트랩 신뢰구간으로 검증
- 도메인 내에서는 문장 전체 확률이 오류 탐지에 가장 강했지만 도메인이 바뀌면 성능이 급락, 개체명 확률과 자기일관성이 더 견고했고 특히 자기일관성은 별도 보정 없이도 신뢰도 수치 자체가 더 정확했음
- 가장 확신하는 상위 40% 문장만 자동 처리하게 하면 도메인 내 문장 오류율이 34.3%에서 2% 미만으로 급감, 금융뉴스에서도 효과 있었지만 일반 트위터 데이터에서는 어떤 임계값으로도 쓸만한 안전 구간을 찾지 못함
- 이를 바탕으로 먼저 입력이 원래 도메인과 얼마나 다른지 감지한 뒤에만 신뢰도 기반 자동/보류 판단을 적용하는 단계적 배포 전략을 제안

| Split | Domain | Sent. | Ent. | PER | ORG | LOC |
|---|---|---|---|---|---|---|
| Train | FIN (filings) [27] | 1014 | 980 | 648 | 175 | 157 |
| Valid | FIN (filings) [27] | 150 | 177 | 97 | 68 | 12 |
| Test | FIN (filings) [27] | 299 | 295 | 201 | 56 | 38 |
| Test | FiNER-ORD (news) [28] | 300 | 322 | 78 | 151 | 93 |
| Test | TweetNER7 (tweets) [30] | 300 | 619 | 381 | 135 | 103 |

| Model | Domain | P | R | F1 | Halluc.% | ECE |
|---|---|---|---|---|---|---|
| BERT-base | FIN | 66.7±2.3 | 74.2±1.4 | 70.3±1.5 | – | 0.102±0.016 |
| BERT-base | FiNER-ORD | 39.1±0.3 | 37.6±2.3 | 38.3±1.1 | – | 0.071±0.017 |
| BERT-base | TweetNER7 | 35.2±5.2 | 18.4±1.7 | 24.1±2.5 | – | 0.074±0.007 |
| Qwen-0.5B | FIN | 40.5±0.4 | 34.7±2.1 | 37.4±1.3 | 3.6±2.4 | 0.362±0.009 |
| Qwen-0.5B | FiNER-ORD | 30.7±1.3 | 18.0±4.4 | 22.6±3.8 | 8.2±0.7 | 0.407±0.005 |
| Qwen-0.5B | TweetNER7 | 30.8±0.7 | 23.7±4.2 | 26.7±2.8 | 5.6±1.1 | 0.370±0.007 |
| Qwen-1.5B | FIN | 47.7 | 44.7 | 46.2 | 4.3 | 0.322 |
| Qwen-1.5B | FiNER-ORD | 56.3 | 48.4 | 52.1 | 3.6 | 0.227 |
| Qwen-1.5B | TweetNER7 | 44.9 | 50.9 | 47.7 | 6.8 | 0.358 |
| Signal | FIN | FiNER-ORD | TweetNER7 | |||
|---|---|---|---|---|---|---|
| AUROC | ECE | AUROC | ECE | AUROC | ECE | |
| Sequence prob. | 0.839±0.014 | 0.512±0.005 | 0.661±0.015 | 0.593±0.011 | 0.626±0.019 | 0.586±0.006 |
| Token prob. | 0.823±0.012 | 0.531±0.004 | 0.666±0.019 | 0.615±0.013 | 0.605±0.018 | 0.611±0.006 |
| Span prob. | 0.801±0.004 | 0.362±0.009 | 0.690±0.030 | 0.407±0.005 | 0.721±0.011 | 0.370±0.007 |
| Type prob. | 0.492±0.019 | 0.506±0.004 | 0.536±0.022 | 0.533±0.019 | 0.511±0.010 | 0.573±0.002 |
| Self-consistency | 0.690±0.019 | 0.116±0.029 | 0.671±0.048 | 0.120±0.015 | 0.682±0.017 | 0.100±0.008 |
| Signal | 0.5B (3 seeds) | 1.5B (1 seed) | ||||
|---|---|---|---|---|---|---|
| FIN | FiNER | Tweet | FIN | FiNER | Tweet | |
| Sequence prob. | 0.839 | 0.661 | 0.626 | 0.764 | 0.720 | 0.637 |
| Span prob. | 0.801 | 0.690 | 0.721 | 0.819 | 0.729 | 0.638 |
| Self-consistency | 0.690 | 0.671 | 0.682 | 0.735 | 0.744 | 0.663 |
| Domain | Signal | P@100% | P@80% | P@60% |
|---|---|---|---|---|
| FIN | Seq. prob. | 40.5±0.4 | 49.0±0.8 | 58.4±0.6 |
| FIN | Span prob. | 40.5±0.4 | 49.2±0.3 | 56.4±0.6 |
| FIN | Self-consistency | 40.5±0.4 | 47.7±0.4 | 52.8±1.0 |
| FiNER | Seq. prob. | 30.7±1.3 | 34.9±3.0 | 40.1±1.3 |
| FiNER | Span prob. | 30.7±1.3 | 35.3±1.7 | 40.8±2.6 |
| FiNER | Self-consist. | 30.7±1.3 | 34.9±3.0 | 41.4±2.3 |
| Tweet | Seq. prob. | 30.8±0.7 | 34.2±1.0 | 36.8±2.9 |
| Tweet | Span prob. | 30.8±0.7 | 36.6±1.1 | 42.7±1.1 |
| Tweet | Self-consist. | 30.8±0.7 | 35.5±1.7 | 40.5±1.5 |
| Filtered | Relaxed | |
|---|---|---|
| Sentences dropped (of 2807) | 2179 | 0 |
| Evaluated (cap 300) | 300 | 300 |
| Gold PER/ORG/LOC | 619 | 443 |
| Ignored entities | 0 | 488 |
| Encoder F1 | 24.1±2.5 | 19.5±1.0 |
| Encoder MSP AUROC | 0.615±0.054 | 0.650±0.047 |
| Qwen-0.5B F1 | 29.7 | 29.1 |
| Qwen-0.5B span AUROC | 0.725 | 0.715 |
왜 중요한가
금융 규제·리스크 관리처럼 오류가 실제 피해로 이어지는 분야에서는 AI 정확도 숫자만으로는 언제 결과를 믿고 자동화해도 되는지 알 수 없다. 이 연구는 입력 데이터의 성격이 바뀔 때 AI의 자신감 표시 자체가 오작동할 수 있음을 보여주고, 어떤 신뢰도 지표를 언제 써야 하는지에 대한 구체적 근거를 제공한다.
이 논문의 용어
- 개체명 인식(NER) · 문장에서 사람, 회사, 지역 같은 고유명사를 찾아 분류하는 AI 작업
- 도메인 변화(distribution shift) · AI가 학습한 데이터와 실제 사용 환경의 문장 스타일·주제가 달라지는 현상
- 선택적 예측(selective prediction) · AI가 확신 없는 입력은 답을 내지 않고 사람 검토로 넘기는 방식
- 자기일관성(self-consistency) · 같은 입력에 대해 AI가 여러 번 답을 생성했을 때 얼마나 같은 답이 나오는지로 신뢰도를 재는 방법
- LoRA · 거대 언어모델 전체를 다시 학습시키지 않고 일부 작은 파라미터만 추가로 학습시키는 효율적 미세조정 기법
- AUROC / ECE · AUROC는 신뢰도가 실제 오류를 얼마나 잘 구분하는지, ECE는 AI가 말하는 확신 수치가 실제 정답률과 얼마나 잘 맞는지(보정 정도)를 나타내는 지표
논문 원문 초록 (영문)
Financial AI systems often train information extractors on one textual register and deploy them across filings, news, and user-generated content, while standard F1 scores do not indicate which predictions remain safe to automate when the input distribution changes. We study confidence estimation and selective prediction for financial named entity recognition (NER) on a three-tier stress test spanning SEC filings, financial news, and general-topic social media as an extreme out-of-domain condition. We evaluate a BERT tagger and LoRA-tuned Qwen2.5-0.5B/1.5B models using five inference-time confidence signals, three training seeds, and bootstrap intervals. Confidence rankings themselves change under distribution shift: whole-output probability is the strongest in-domain error detector but deteriorates out of domain, whereas entity-span probability and self-consistency are more robust; self-consistency is also better calibrated without post-hoc fitting. Abstention reduces sentence error from 34.3% to below 2% on the highest-confidence 40% of in-domain inputs and remains useful on financial news, but recovers no usefully large clean subset under the extreme social-media shift. These results motivate a staged deployment strategy that detects severe distribution shift upstream before applying prediction-level confidence gating.
arXiv에서 원문 보기최신 논문
- Stopping and Routing LLM Judge PanelsAI 채점관을 몇 명 불러야 하는지, 언제 멈춰야 하는지 정하는 방법
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
- Generating Diverse Personas for User Simulators to Test Interview Dialogue Systems인터뷰형 대화 시스템을 테스트하려면 다양한 가상 사용자가 필요한데, LLM으로 그런 가짜 사용자 성격을 자동으로 만들어냈다
- Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa문서 요약 AI 3종(BERT, RoBERTa, BART)을 같은 조건에서 직접 붙여본 결과, 글을 새로 써주는 BART가 압도적으로 앞섰다
- Rethinking Patch Based Multivariate Time Series Forecasting with Semantic Structured Partitioning시계열을 일정 구간으로 자르지 말고, 의미 단위로 잘라서 예측하자는 새 방법
- Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysisAI가 뇌영상 분석을 대신할 때, '왜 이 결론을 믿어도 되는가'까지 기록하게 만든 시스템
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
METAL LAB 최신 기사
그림 출처: Zihao Zheng et al., arXiv:2608.19558, arxiv-nonexclusive