每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Databricks发布企业文档推理基准OfficeQA Pro V2

该评测集衡量AI基于企业内部资料作答的能力,题目规模通过合成数据扩充

OfficeQA Pro V2에서 모델별 정확도를 비교한 막대 그래프

이미지: Databricks 화면 갈무리

摘要

  • Databricks于2026年8月6日通过官方博客公布了新基准OfficeQA Pro V2。
  • 该基准旨在评估"有据推理"能力,即基于企业资料生成答案的能力,博客中同时公布了多个智能体的测评结果。
  • 题库先由人工编写,再通过合成数据扩大规模。
발표 주체
Databricks (Databricks Blog)
공개일
2026년 8월 6일
이름
OfficeQA Pro V2
평가 대상
기업 환경의 그라운디드 리즈닝(enterprise grounded-reasoning)
구성
에이전트 성능 결과, 벤치마크 구축 방법, 합성 데이터 기반 확장, 예시 질문, 벤치마크 상세

公司内部向AI提出的问题通常是这样的:"根据这些报告,帮我分析一下第三季度合同续约率为何下降。"答案不在模型的知识库里,而在堆积的企业内部文档中。Databricks于8月6日发布的新基准,正是瞄准了这一点进行测评。

发布了什么

Databricks通过官方博客公布了OfficeQA Pro V2。这是一个专为评估企业环境中"有据推理"(grounded reasoning)——即依据给定资料进行推理并作答的能力——而设计的基准。公开文章的结构依次是:多个智能体在该基准上的测评结果、新基准的构建过程、通过合成数据扩大规模的方法、示例问题,以及基准的详细规格。名称中的V2表明这是此前版本的后续升级。

为何"有据推理"是个难题

模型擅长应付考试题,和读懂公司文档并作答是两件不同的事。后者出错的方式要混乱得多。模型可能会煞有介事地编造资料中并不存在的数字(幻觉),也可能答案分散在三份文档中却只看第一份就下结论,还可能明明找到了正确的依据句子,但据此进行的计算却出错。当PDF合同、季度业绩表、演示文稿等格式混杂的资料同时出现时,难度还会再上一个台阶。

问题在于,这类失误用现有基准很难捕捉到。像MMLU这类知识型考试测的是模型已经知道的东西。而企业真正关心的是"给了我们的文档,它能不能做对"。因此各家企业常用内部资料自建评测集,但由于不公开,无法互相比较。这正是公开基准不断涌现的原因。

这里还有另一道门槛。这类题目需要人工编写才能保证质量,而这样一来数量往往止步于几百道。Databricks专门用一节篇幅讨论"利用合成数据扩大规模",可以理解为是对如何跨过这一瓶颈的回答。用模型批量生成题目可以解决规模问题,但难度是否保持均衡、答案是否真正能在资料中得到验证,就成了新的课题。

Databricks为何要发布基准

Databricks是由创建Apache Spark的研究团队创立的数据平台公司。其主业是在企业积累的数据之上叠加分析与AI能力,近年来重心已转向运行在这些数据之上的智能体。8月10日,公司重启了走访20个城市的"Data + AI World Tour",并接连公布了会计与咨询事务所CLA在智能体编排方面的应用案例。以企业内部数据为依据展开工作的智能体,正是该公司产品的核心场景。这样一家公司亲自制定评测标准,同时也是在就"该如何定义问题"这件事上表明自己的立场。

这意味着什么

对于正在考虑引入企业内部AI的一方而言,多了一个可参照的基准。这意味着"这个模型能不能用我们的文档也做到"这个问题,不必再靠主观判断,而可以借助一套公开的题库来验证。从整体趋势看,这也与模型性能竞争的重心正从"知道什么"转向"拿到资料后能做什么"相吻合。将基准测试本身做成产品的尝试也在增多——Artificial Analysis于8月10日开放了面向开发者的基准测试产品套件的早期访问申请。不过,本次发布中各智能体具体获得了多少分,还需直接查看原文中的结果表格。