Databricks新闻
Databricks 举办首届 Grounded Reasoning Cup,评估 AI 智能体的实时推理能力
Databricks 举办了首届 Grounded Reasoning Cup,邀请 11 支学术团队在全新基准 OfficeQA Pro V2 上实时测试 AI 智能体。结果显示,基线前沿模型平均准确率不足 30%,而斯坦福团队通过端到端优化达到 63.3%。比赛凸显了泛化挑战,并指出企业级推理仍有很大提升空间。
今年,Databricks 举办了首届 Grounded Reasoning Cup,这是一场开创性的现场 AI 竞赛,旨在评估 AI 智能体对复杂、企业级文档集合进行推理的能力。通过在实时竞赛条件下,让智能体接受新发布语料库的测试,Grounded Reasoning Cup 旨在帮助回答 AI 评估中最棘手的问题之一:在基准测试上的性能提升,能在多大程度上泛化到类似的现实世界任务中?
本次竞赛汇集了来自美国和加拿大的 11 支顶尖学术团队,并为他们配备了来自 OpenAI、Anthropic 和 Google DeepMind 等前沿实验室的资源与指导。在两个月的时间里,各团队在 OfficeQA(我们旗舰级的、旨在反映具有经济价值的企业工作流程的扎根推理基准测试)上开发并优化了他们的智能体。在竞赛当天,他们需要将这些系统实时应用于一个新发布的扎根推理基准测试——OfficeQA Pro V2,该基准旨在检验他们的改进是否具有泛化能力。
斯坦福大学凭借其系统以 63.3% 的准确率夺冠,比参赛团队的平均水平高出约 22 个百分点,比前沿智能体的离线基线平均水平高出约 35 个百分点。顶尖团队通过文档预处理、定向检索、并行智能体、结构化工具使用和验证,展现了显著的性能提升。与此同时,有 18.8% 的问题没有任何团队能够解决,这凸显了企业级扎根推理仍有巨大的提升空间。
在这篇博文中,我们将回顾本次竞赛,并讨论来自 Grounded Reasoning Cup 获胜团队——斯坦福大学、马萨诸塞大学阿默斯特分校和耶鲁大学——的智能体优化策略与见解。

- 泛化能力需要具有代表性的、留出的评估。在 OfficeQA 上开发的技术并不总能可靠地迁移到我们的新基准测试中。这强调了利用像 OfficeQA Pro V2 这样的留出测试集来确保解决方案能够泛化到新样例的重要性。
- 智能体的性能取决于整个系统,而不仅仅是模型。使用相同模型的最高分团队和最低分团队之间的平均差距为 30.4 个百分点。解析、检索、工具使用、验证、并行化以及运维基础设施,都决定了智能体能否成功完成端到端的扎根推理任务。
- 企业级扎根推理远未得到解决。即使是获胜团队,在基准测试的许多检索、解析和分析要求上也面临困难,这为持续的研究和改进留下了巨大空间。我们鼓励从业者使用公开可用的 OfficeQA 基准测试套件,继续推进这项工作。
竞赛设置
Grounded Reasoning Cup 的目标是汇聚顶尖学术团队,开发针对扎根推理的通用方法——这是企业环境中的一项常见任务,涉及利用大型(通常是专有的)文档集合中的证据来回答复杂问题。
由 2-4 人组成的代表其学术机构的团队,与来自 OpenAI、Anthropic 或 Google DeepMind 的行业伙伴配对,后者在开发期间提供其模型的使用权限和指导。团队有大约两个月的时间,使用他们认为合适的任何方法构建智能体,唯一的限制是必须完全使用其合作实验室的模型系列来驱动他们的智能体。在此期间,他们使用 OfficeQA 基准测试来评估他们认为能够泛化到类似扎根推理任务的新技术。
在竞赛当天,各团队的任务是将他们的智能体实时应用到一个全新的、刚刚发布的基准测试上。竞赛受以下规则约束:
- 基准测试发布:新语料库(美国财政部收支账目)在比赛开始前仅36小时发布。这给了各团队处理数据和建立索引的时间,同时限制了方法对新基准过拟合的机会。
- 设计约束:团队可以使用任何智能体框架、语料库版本、检索策略、工具使用设置或人机协同工作流,只要他们使用其指定行业实验室合作伙伴提供的模型即可。
- 形式:比赛由六轮组成,每轮15分钟,每轮15道题。随着比赛推进,难度逐轮增加。
- 计分:每答对一题得1分。为了激励低延迟,如果某个团队第一个正确回答某道题,还可获得0.25分的速度奖励。最后一轮由最具挑战性的题目组成,该轮得分按2倍计算。每个团队在整个比赛中还拥有3次重新提交的机会,可以选择用其修正之前的答案。
团队表现与经验教训
这场比赛明确了一点:自我们7个月前发布OfficeQA基准以来,企业级文档语料库上的基于证据的推理能力有所提升,但距离解决这一问题仍有很大差距。团队平均得分约为41%,前三名团队的准确率超过50%,斯坦福大学团队以63.3%的准确率赢得比赛。这些结果表明顶尖团队做出了令人印象深刻的工作,同时也意味着仍有大量探索空间。
获胜团队策略
虽然每个团队都采用了独特的方法,但前三名团队构建的智能体呈现出几种共同模式。强大的系统往往结合了细致的文档预处理、有针对性的检索、结构化的工具使用和答案验证步骤。在许多情况下,性能更多取决于整个系统而非单次模型调用:文档如何解析、证据如何检索、中间计算如何执行,以及提交前答案如何验证。虽然这些是性能最优系统普遍具备的特质,但它们各自也采用了独特且富有创意的策略,如下所述。
第一名:斯坦福大学

斯坦福团队的获胜方法源于将常见的基于证据推理失败模式转化为可复用的操作流程,供其Claude Opus 4.8 Claude Code智能体学习并在比赛题目中应用。在基于公开OfficeQA基准的开发过程中(包括使用Opus 4.8乃至Fable 5进行消融实验),团队反复将错误答案追溯到智能体的具体失误步骤,然后将这些模式转化为表格定位、答案格式化、常见财务表述澄清等技能。团队还整合了用于决定何时在解析后的语料文本和Markdown风格文档表示中进行搜索、以及当解析文本缺乏完整上下文时何时回退到原始PDF的技能。到比赛日时,斯坦福团队已为其智能体准备了包含100多项技能的操作手册。他们在尝试的88道题中答对57道,准确率领先所有团队。

尽管做了如此深入的准备,斯坦福团队仍不得不在比赛过程中调整策略。在前三轮中,该团队使用另一个Claude Code智能体作为验证器,重新提取中间值,检查常见失败模式(如通过数据血缘追踪修订值、处理单位换算),并在发现差异时修补计算。但在前三轮仅获得两次速度奖励后,斯坦福团队在最后三轮移除了额外的验证步骤。这一改变显著降低了延迟,帮助团队在14道题上获得速度奖励,并推动了他们的逆袭。然而,验证器在最后一轮被证明是决定性的——斯坦福团队重新启用它,通过最后一次重新提交修正了一个答案,最终锁定了胜局。
第二名:马萨诸塞大学阿默斯特分校
马萨诸塞大学团队押注于速度。他们使用Claude Opus 4.8 Fast作为主要模型,并对语料库进行预处理,创建了一个元数据目录,从而能够对解析后的文档进行快速搜索和过滤。为了在保持低延迟的同时提高答案质量,他们对每道题并行运行三个智能体,最后通过一次Opus验证调用来选择最佳答案。

这一策略使UMass在正确答案上的平均提交时间最快:四分钟,不到团队平均八分三十秒的一半。因此,他们获得了36次速度奖励(每次价值0.25分),成为首个正确作答的团队,是第二名斯坦福大学16次的两倍多。这些奖励帮助他们在半场时建立起对斯坦福10.25分的领先优势,并在进入最后一轮时仍保有3.75分的优势。UMass一直保持领先,直到比赛最后56秒,斯坦福更慢但更精准的智能体在最难的问题上发挥了决定性作用,最终反超并以1.75分的优势获胜。
UMass的方法展示了更快的模型、文档预处理和测试时扩展如何协同工作,在不牺牲太多准确性的情况下实现极低延迟。
第三名:耶鲁大学
耶鲁团队构建了一个多臂验证框架,旨在任何单个智能体失败时仍能保持稳健。该系统并行运行四个独立分支,涵盖两种智能体策略。两个分支使用自主ReAct智能体:一个由Gemini 3.1 Pro驱动,另一个由Gemini 3.5 Flash驱动。其余分支使用更结构化的规划器-验证器流水线,所有LLM调用均由Gemini 3.1 Pro驱动。在该流水线中,规划器检查并情境化源文档,组装包含回答问题所需证据的草稿本。随后验证器检查引用的来源并执行最终计算。

一个Gemini 3.1 Pro元验证器审查所有四个分支生成的答案和推理过程,并选择最终回复。为降低引入新的无依据答案的风险,元验证器只能从现有分支提出的答案中进行选择。当无法做到时,系统回退到多数投票机制。通过将不同的智能体架构与独立、部分去相关的故障模式相结合,耶鲁强调了持续、有依据的验证。该方法使团队获得第三名,90道题中正确回答49道,并在六轮比赛中的四轮中正确率排名前三。
获胜团队策略总结
这些获胜方法的核心要点之一是:将智能体成功应用于端到端有依据推理任务需要整体系统思维,而非仅仅选择模型。在各获胜方案中,几个关键设计杠杆尤为突出:
- 解析质量:顶级团队使用预解析文档,并经常增强这些解析表示以包含额外元数据(如图表描述或页面级元数据),同时保留回源PDF的路径,以便在解析文本不完整时回退。在我们自己对OfficeQA Pro V2的研究中,我们发现使用ai_parse预解析文档对Genie相比基线前沿智能体24.0个百分点的性能提升有显著贡献。
- 检索质量:强大的系统不依赖通用的top-k分块搜索。它们转而使用某种形式的词法检索(如grep),通常与稠密检索结合形成混合方法。
- 工具使用:成功的智能体通常将搜索、文档检查、计算、比较和提交委托给专用工具。
- 验证策略:多个团队通过验证智能体或LLM调用构建了某种形式的显式验证检查,以提升答案质量。
- 稳健框架:在实时截止压力下,预处理、重试逻辑、并行化和提交脚手架等操作细节对于确保正确答案及时提交至关重要。
这些因素决定了模型能否在截止压力下可靠地找到正确证据、执行正确计算并提交正确答案。
影响与后续步骤
泛化能力必须经过测试,而不能想当然。在OfficeQA上的改进并不总能迁移到OfficeQA Pro V2上,前沿智能体平均仍答不对其中一半以上的问题。在熟悉的基准上的进步,并不一定意味着在新语料或新任务分布上同样有效。
具有代表性且留出的评估至关重要。这些评估应检验真正重要的泛化形式,理想情况下,保持任务的核心特性不变(即对文档的基于事实的推理),同时改变任务中可能变化的要素,例如语料库。在我们介绍OfficeQA Pro V2的文章中,我们讨论了如何利用合成数据,结合我们对客户工作流程的了解,快速扩展这些具有代表性的评估。
智能体的性能取决于整个系统。性能不仅取决于模型本身,还取决于解析、检索、工具调用、验证,以及底层数据和基础设施的质量。获胜团队对这些组件进行了整体优化。同样,Genie在使用ai_parse等工具对文档进行预解析,并采用额外的harness优化策略时,其表现显著优于基线前沿智能体。
我们感谢所有参赛团队及行业赞助方,包括OpenAI、Google DeepMind和Anthropic,感谢他们参与Databricks首届Grounded Reasoning Cup,并共同推动该领域的发展。我们也感谢USAFacts的持续合作,从帮助我们确定新语料库并为OfficeQA Pro V2编写相关问题,到与我们共同举办此次竞赛。最后,我们感谢美国财政部帮助确定将《美国收支账目》作为竞赛基准的基础,并首次将该数据集作为一个整体发布。
作者:Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Brooke Wenig, Denny Lee, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia
订阅获取最新文章
注册