FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems
AI经常能说对财务对账出错的原因,却拿不出真正的证据
一个名为FinRCA-Bench的新基准专门测试AI系统能否准确诊断发票、付款、银行记录之间对不上账的原因。研究人员只更换检索证据的方法、保持AI模型本身不变,结果准确率就从2.05%飙升到72.44%,说明起决定作用的是能否找到正确的证据记录,而不是模型本身的推理能力。即便答对了,严格满足证据要求的比例也只有5.72%。
他们做了什么
- 该基准包含2,250个跨14张操作表的合成应付账款到银行对账案例,其中1,500例被人为植入了15类失败原因,另外750例是合法但容易混淆的'难负例'。
- 研究对比了按文字相似度检索的传统方法(Dense RAG)和只沿着真实存在的交易关系遍历的类型化溯源图检索方法(TPGR),并在完全相同的下游推理模型下进行测试。
- 仅更换检索方式,所需证据记录的平均召回率就从0.83%提升到77.70%,16分类的准确率从2.05%提升到72.44%;相比之下,传统的规则系统已达到84.97%,经典机器学习方法更是达到95.44%,说明AI在此任务上并非天然占优。
- 在437个案例中有311个(占71.17%)虽然给出了正确分类,却未能满足证据要求;严格通过证据契约检验的比例仅5.72%。剩余错误中,95起是因为检索失败,只有15起才是真正的推理错误。
为什么重要
对于打算在财务系统中部署AI的人来说,答案正确并不代表系统真正找到了能证明该答案的记录,这在需要审计追溯的场景中至关重要。这项研究用具体数据表明,检索架构而非模型能力,往往才是决定端到端表现的关键瓶颈。
本文术语
- RAG(检索增强生成) · AI在生成答案前先检索相关资料作为参考的技术
- TPGR(类型化溯源图检索) · 只沿着预先定义的真实交易关系寻找证据、不依赖相似度计算的检索方法
- 难负例(hard negative) · 看起来异常但实际上是正常情况的测试案例,用来检验系统是否会误判
- 宏观召回率(macro recall) · 各案例所需证据被完整找到程度的平均值
- 溯源(provenance) · 记录之间真实存在关联的可追溯证据链
论文原文摘要(英文)
Large language models are increasingly used to support financial operations, but their apparent reasoning performance can depend on whether they receive the right evidence. In financial reconciliation, the evidence needed for diagnosis is distributed across invoices, purchase orders, approvals, allocations, payments, ledger entries, and bank activity, linked by transactional relationships rather than textual similarity. End-to-end accuracy can ther
在 arXiv 阅读最新论文
- FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents让AI连续管理一家足球俱乐部20年后发现,胜负关键不在模型大小,而在经营习惯
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisFACET:让终端命令行任务的“说明书、环境、答案、判分器”自动保持一致
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models语言模型全程冻结,只训练一个小连接器,也能做出好用的听觉理解AI
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI代码审查:与其堆更多智能体,不如让一个审查者和一个批评者互相较真
- Looped Language Models Improve Compositional Tool Calling会反复回想自己答案的AI模型,更擅长按顺序组合调用多个工具
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-EngagementAI智能体追着离场用户发WhatsApp,把逛而不买的顾客拉回来
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks把病毒基因序列变成密码子关系网络图,用来区分新冠变异株
- Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval图文检索AI误以为自己已经全学会了,结果学不会区分那些几乎一样的描述句子