每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems

arXiv:2608.185342026-08-20

AI经常能说对财务对账出错的原因,却拿不出真正的证据

一个名为FinRCA-Bench的新基准专门测试AI系统能否准确诊断发票、付款、银行记录之间对不上账的原因。研究人员只更换检索证据的方法、保持AI模型本身不变,结果准确率就从2.05%飙升到72.44%,说明起决定作用的是能否找到正确的证据记录,而不是模型本身的推理能力。即便答对了,严格满足证据要求的比例也只有5.72%。

他们做了什么

  1. 该基准包含2,250个跨14张操作表的合成应付账款到银行对账案例,其中1,500例被人为植入了15类失败原因,另外750例是合法但容易混淆的'难负例'。
  2. 研究对比了按文字相似度检索的传统方法(Dense RAG)和只沿着真实存在的交易关系遍历的类型化溯源图检索方法(TPGR),并在完全相同的下游推理模型下进行测试。
  3. 仅更换检索方式,所需证据记录的平均召回率就从0.83%提升到77.70%,16分类的准确率从2.05%提升到72.44%;相比之下,传统的规则系统已达到84.97%,经典机器学习方法更是达到95.44%,说明AI在此任务上并非天然占优。
  4. 在437个案例中有311个(占71.17%)虽然给出了正确分类,却未能满足证据要求;严格通过证据契约检验的比例仅5.72%。剩余错误中,95起是因为检索失败,只有15起才是真正的推理错误。

为什么重要

对于打算在财务系统中部署AI的人来说,答案正确并不代表系统真正找到了能证明该答案的记录,这在需要审计追溯的场景中至关重要。这项研究用具体数据表明,检索架构而非模型能力,往往才是决定端到端表现的关键瓶颈。

本文术语

  • RAG(检索增强生成) · AI在生成答案前先检索相关资料作为参考的技术
  • TPGR(类型化溯源图检索) · 只沿着预先定义的真实交易关系寻找证据、不依赖相似度计算的检索方法
  • 难负例(hard negative) · 看起来异常但实际上是正常情况的测试案例,用来检验系统是否会误判
  • 宏观召回率(macro recall) · 各案例所需证据被完整找到程度的平均值
  • 溯源(provenance) · 记录之间真实存在关联的可追溯证据链

论文原文摘要(英文)

Large language models are increasingly used to support financial operations, but their apparent reasoning performance can depend on whether they receive the right evidence. In financial reconciliation, the evidence needed for diagnosis is distributed across invoices, purchase orders, approvals, allocations, payments, ledger entries, and bank activity, linked by transactional relationships rather than textual similarity. End-to-end accuracy can ther

作者 · Pratik Ghawate

在 arXiv 阅读

最新论文

全部论文 →

METAL LAB 最新报道