亮点
公告基准测试

更难的数据,同一个智能体:各模型下滑了多少

更难的 Databricks OfficeQA 数据、同一个 Energent 智能体、七个前沿模型:Fable 5.1 和 GPT-5.6 Sol 的降幅保持在 3 分以内,其余五个下降了 6 到 29 分。

Energent 团队
七个模型从 OfficeQA v1 到 v2 的下降箭头图:Fable 5.1 和 GPT-5.6 Sol 保持稳定,其余五个下滑
以完整分辨率打开图表

Databricks 通过第二版让 OfficeQA 变得更难。我们保持 Energent 智能体不变,在两个版本上对比了同一批模型。上图中的箭头展示了每个模型在两版之间损失了多少。

摘要

  • 两个模型保持稳定:Fable 5.1(72.2% → 70.0%)和 GPT-5.6 Sol(71.4% → 68.9%)。五个模型下降了 6.5 到 28.8 分。
  • 排名重新洗牌。Opus 5 以 74.4% 领跑 v1,却跌至第三;Sonnet 5 从 67.7% 降到 38.9%,从第五掉到垫底。
  • “更难”是可以量化的:语料库规模是原来的 2×(697 → 1,435 份文档),每题引用的文档数是原来的 3.7×(1.8 → 6.7),每题需要阅读的文本量约为原来的 9×(≈1 MB → ≈9 MB)。
  • 对 Energent 用户而言,无需任何配置:智能体与模型无关,因此随着您的任务规模增长,我们会进行测量,选出经得住考验的模型,为您保持最佳的性能与速度。

背景:OfficeQA,从 v1 到 v2

OfficeQA 是 Databricks 推出的基准测试,考察基于美国财政部财务报告的有据推理能力。本文中的 v1 指 OfficeQA Pro,在首次公告中发布:即原始基准测试中标记为困难的 133 道题目,覆盖 697 份财政部公报,由人工标注者手写而成。

v2 指 OfficeQA Pro V2,在第二次公告中发布:90 道题目,覆盖 1,435 份 1793 到 2024 年联邦收支的扫描账簿。

两相对比,v2 在对智能体至关重要的每个维度上都更难:

v1v2变化
语料库中的文档数6971,435
每题引用的文档数(均值)1.86.73.7×
每题需阅读的文本量(均值)≈1 MB≈9 MB≈9×

很少有基准测试会为同一任务推出第二版。OfficeQA 做到了,这让难度成为一个可以据以测量的维度。

我们如何测试

  • **为什么选择 OfficeQA。**它很像我们的用户带到 Energent 上的工作:找到正确的文档,从密集的表格中提取数字,将它们组合起来,并返回一个可以核验的精确答案。
  • **同一个智能体,只更换模型。**Energent 智能体与模型无关。相同的工具、提示词和步数预算,在两个版本上运行了来自 Anthropic、OpenAI 和 Google 的七个前沿模型。更难的数据是导致下滑的原因;在智能体固定不变的情况下,各模型下滑幅度的差异归因于模型本身,而非智能体。
  • **对每个模型采用相同规则。**每个答案都由基准测试的官方评分器评分,每个模型运行一次。

结果

准确率,从 v1 到 v2

官方评分器下的答案准确率,按 v2 分数排序。

模型v1(133 题)v2(90 题)变化
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • 在 v1 上,七个模型中有五个落在 7 分的区间内;在 v2 上,同样这七个模型的跨度达到 31 分。
  • 保持稳定的两个模型 Fable 5.1 和 GPT-5.6 Sol 在 v1 上处于中游,在 v2 上则分列第一和第二。

v1:成本与推理概况

模型每题成本平均时长每题模型调用数每题工具调用数每次调用的工具数
Fable 5.1$0.581.7 分钟11.610.70.93
GPT-5.6 Sol$0.732.3 分钟13.623.91.76
Opus 5$0.491.4 分钟9.711.61.20
Fable 5$0.941.6 分钟8.511.01.29
GPT-5.6 Terra$0.261.7 分钟13.721.61.58
Gemini 3.1 Pro$0.301.3 分钟17.816.20.91
Sonnet 5$0.282.2 分钟12.314.01.14

v2:成本与推理概况

模型每题成本平均时长每题模型调用数每题工具调用数每次调用的工具数
Fable 5.1$1.243.2 分钟18.117.60.97
GPT-5.6 Sol$2.126.9 分钟24.361.92.55
Opus 5$0.982.7 分钟17.019.41.14
Fable 5$2.004.0 分钟14.819.51.31
GPT-5.6 Terra$0.633.8 分钟20.743.42.10
Gemini 3.1 Pro$1.015.3 分钟38.436.90.96
Sonnet 5$0.837.0 分钟25.933.01.27
  • 每个模型在 v2 上都付出了更多:每题成本为原来的 2 到 3.4 倍,模型和工具调用数为原来的 1.5 到 2.6 倍,耗时为原来的 1.9 到 4.1 倍。
  • 保持稳定的两个模型走了不同的路:Fable 5.1 的工具调用数在所有模型中最少,每题 3.2 分钟;GPT-5.6 Sol 的工具调用数最多,每题 6.9 分钟。

结论

OfficeQA 的两个版本提供了一种难得的东西:同一任务的两个难度级别,让您可以看到随着任务变难,哪些模型能够持续发挥,哪些模型会下滑。在 v1 上,七个模型挤在一起;在 v2 上,它们被远远拉开。简单的数据掩盖了模型之间的差异,困难的数据则将其暴露出来。

对 Energent 用户而言,这个选择由我们持续替您做出:随着您的任务变难,我们会在您这类工作上测量各个模型,选出经得住考验的那一个,并在准确率与速度和成本之间取得平衡,您无需进行任何配置。

致谢

特别感谢 Databricks 团队推出 OfficeQA:一个原始、高质量且刻意加大难度的数据集,基于真实文档构建,题目经过仔细核验,并以同一任务的两个版本发布。正是这种延续性让我们得以看到这一趋势。关于这些结果的详细论文正在撰写中。

参考资料

  1. Databricks,介绍 OfficeQA,第一版公告
  2. Databricks,介绍 OfficeQA Pro V2,第二版公告
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning,arXiv 2603.08655
  4. GitHub 上的 OfficeQA 代码库
  5. Hugging Face 上的 OfficeQA Pro V2 数据集

解决方案

硬件

AI 辅助的 CAD 审查和工程设计工作流。