FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems
AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
회사 장부에서 거래가 안 맞을 때 그 원인을 찾아내는 AI를 테스트하는 벤치마크 FinRCA-Bench가 나왔다. 같은 언어모델에 검색 방식만 바꿔줬더니 정답률이 2%에서 72%로 급등했는데, 이는 모델이 똑똑해져서가 아니라 필요한 증거 기록을 얼마나 잘 찾아주느냐의 차이였다. 정답을 맞힌 경우조차 절반 넘게 제대로 된 증거 없이 우연히 맞춘 것으로 드러났다.
무엇을 했나
- 송장, 발주서, 결제, 은행거래 등 14개 표에 걸쳐 흩어진 2,250건의 가상 회계 사례로 벤치마크를 만들었다. 1,500건은 일부러 오류를 심은 사례(15가지 원인 유형), 750건은 정상이지만 헷갈리기 쉬운 사례다.
- 단순 텍스트 유사도로 검색하는 방식(Dense RAG) 대신, 실제로 시스템에 저장된 거래 관계만 따라가는 그래프 검색 방식(TPGR)을 도입해 같은 AI 모델에 검색 방법만 바꿔가며 비교했다.
- 검색 방식만 바꿨는데도 필요한 증거를 찾아내는 비율이 0.83%에서 77.70%로, 정답률이 2.05%에서 72.44%로 크게 올랐다. 반면 전통적인 규칙 기반 시스템은 84.97%, 머신러닝은 95.44%의 정확도를 이미 기록해, AI가 이 분야에서 항상 뛰어난 건 아니라는 점도 확인됐다.
- 정답을 맞힌 437건 중 311건(71.17%)은 실제로는 요구되는 증거 조건을 충족하지 못한 채 맞힌 경우였고, 엄격한 증거 기준을 통과한 비율은 5.72%에 불과했다. 오류의 대다수(95건 대 15건)는 AI의 추론 실수가 아니라 애초에 필요한 자료를 찾지 못한 '검색 실패'였다.
왜 중요한가
기업 재무 자동화에 AI를 도입할 때, 정답률만 보고 '잘한다'고 판단하면 실제로는 근거 없는 추측을 신뢰하게 될 위험이 크다. 이 연구는 답이 맞았는지와 그 답을 뒷받침할 증거를 실제로 찾았는지를 분리해서 봐야 한다는 것을 구체적 수치로 보여준다.
이 논문의 용어
- RAG(검색 증강 생성) · AI가 답을 만들기 전에 관련 자료를 먼저 찾아와 참고하게 하는 기법
- TPGR(유형화된 출처 그래프 검색) · 미리 정의된 실제 거래 관계만 따라가며 자료를 찾는, 유사도 계산을 쓰지 않는 검색 방식
- hard negative(어려운 오답 후보) · 겉보기엔 이상해 보이지만 실제로는 정상인 사례, AI를 헷갈리게 하려고 넣은 시험 문제
- 매크로 리콜(macro recall) · 각 사례별로 필요한 자료를 얼마나 빠짐없이 찾았는지의 평균 비율
- provenance(출처/이력) · 어떤 기록이 어디서 왔고 다른 기록과 어떻게 실제로 연결되는지를 보여주는 근거 사슬
논문 원문 초록 (영문)
Large language models are increasingly used to support financial operations, but their apparent reasoning performance can depend on whether they receive the right evidence. In financial reconciliation, the evidence needed for diagnosis is distributed across invoices, purchase orders, approvals, allocations, payments, ledger entries, and bank activity, linked by transactional relationships rather than textual similarity. End-to-end accuracy can ther
arXiv에서 원문 보기최신 논문
- FM-Bench: A Benchmark for Long-Horizon Management with Competing AgentsAI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisAI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACET
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다
- Looped Language Models Improve Compositional Tool Calling생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법
- Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval이미지-긴문장 검색 AI가 '이미 다 맞혔다'고 착각해서 정작 헷갈리는 문제를 못 배우던 버릇을 고쳤다