
摘要
- Databricks于2026年8月6日通过博客公开了新基准OfficeQA Pro V2。
- 该基准旨在评估基于企业资料进行推理作答的"有据推理"能力,并同时公布了智能体性能测评结果。
- 题目采用先由人工编写、再以合成数据扩大规模的方式构建。
公司内部向AI提出的问题大多是这样的:"请根据这些报告,梳理一下第三季度合同续约率下降的原因。"答案不在模型的"脑子"里,而在企业内部的文档堆里。Databricks于8月6日公开的新基准,测的正是这一点。
发布了什么
Databricks通过官方博客公开了OfficeQA Pro V2。这是一个旨在评估企业环境中"有据推理"(grounded reasoning,即依据给定资料进行推理作答的能力)的基准。公开文章依次介绍了多个智能体在该基准上的测评结果、基准的重新构建过程、以合成数据扩大规模的方法、示例问题,以及基准的详细规格。名称中的V2表明这是此前版本的后续版本。
为什么"有据推理"是个难题
模型擅长应试,和它能读懂公司文档并作答,是两码事。后者出错的方式要凌乱得多。模型可能煞有介事地编造资料中不存在的数字(幻觉),也可能明明答案分散在三份文档中,却只看第一份就下结论;还可能明明找对了依据句子,但据此做的计算却是错的。当输入的资料是PDF合同、季度业绩表、发布会幻灯片等格式混杂的材料时,难度更是又上一个台阶。
问题在于,这类失败很难被现有基准捕捉到。像MMLU这样的知识型测试考的是模型已经知道什么。而企业真正关心的是"给它我们自己的文档,它到底行不行"。于是各家公司普遍会用内部资料自建评测集,但由于不公开,彼此之间无法比较。这也是公开基准不断涌现的原因。
这里还有一道坎:这类题目需要人工手写才能保证质量,但这样一来数量往往停留在几百道。Databricks专门用一节讲"利用合成数据扩大规模",可以看作是对如何突破这一瓶颈的回答。用模型批量生成题目能解决规模问题,但难度是否保持均衡、答案是否真的能在资料中得到验证,又成了新的课题。
Databricks为何要发布基准
Databricks是由Apache Spark的创建团队创立的数据平台公司。以企业积累的数据为基础叠加分析与AI是其主业,近年来重心已转向运行在这些数据之上的智能体。8月10日,该公司重启了覆盖20个城市的"Data + AI World Tour",还接连公布了会计与咨询机构CLA的智能体编排应用案例。以内部数据为依据工作的智能体,正是这家公司产品的核心应用场景。这样一家公司亲自制定评测标准,某种程度上也是在同时抛出自己对"问题应如何定义"的主张。
这会带来什么变化
对于正在考虑引入企业内部AI的一方来说,又多了一个参照点——意味着"这个模型用我们自己的文档行不行"这个问题,不必再靠感觉判断,而是可以用公开的题目集来检验。从趋势上看,这也契合了模型性能竞争正从"知道什么"转向"拿着给定资料能做什么"这一阶段。将基准测试本身做成产品的尝试也在增多——Artificial Analysis已于8月10日开放了面向开发者的基准测试产品组合的抢先体验申请。不过,此次公开中各智能体具体得分如何,仍需直接查阅原文中的结果表。





评论