Databricks 通过第二版让 OfficeQA 变得更难。我们保持 Energent 智能体不变,在两个版本上对比了同一批模型。上图中的箭头展示了每个模型在两版之间损失了多少。
摘要
- 两个模型保持稳定:Fable 5.1(72.2% → 70.0%)和 GPT-5.6 Sol(71.4% → 68.9%)。五个模型下降了 6.5 到 28.8 分。
- 排名重新洗牌。Opus 5 以 74.4% 领跑 v1,却跌至第三;Sonnet 5 从 67.7% 降到 38.9%,从第五掉到垫底。
- “更难”是可以量化的:语料库规模是原来的 2×(697 → 1,435 份文档),每题引用的文档数是原来的 3.7×(1.8 → 6.7),每题需要阅读的文本量约为原来的 9×(≈1 MB → ≈9 MB)。
- 对 Energent 用户而言,无需任何配置:智能体与模型无关,因此随着您的任务规模增长,我们会进行测量,选出经得住考验的模型,为您保持最佳的性能与速度。
背景:OfficeQA,从 v1 到 v2
OfficeQA 是 Databricks 推出的基准测试,考察基于美国财政部财务报告的有据推理能力。本文中的 v1 指 OfficeQA Pro,在首次公告中发布:即原始基准测试中标记为困难的 133 道题目,覆盖 697 份财政部公报,由人工标注者手写而成。
v2 指 OfficeQA Pro V2,在第二次公告中发布:90 道题目,覆盖 1,435 份 1793 到 2024 年联邦收支的扫描账簿。
两相对比,v2 在对智能体至关重要的每个维度上都更难:
| v1 | v2 | 变化 | |
|---|---|---|---|
| 语料库中的文档数 | 697 | 1,435 | 2× |
| 每题引用的文档数(均值) | 1.8 | 6.7 | 3.7× |
| 每题需阅读的文本量(均值) | ≈1 MB | ≈9 MB | ≈9× |
很少有基准测试会为同一任务推出第二版。OfficeQA 做到了,这让难度成为一个可以据以测量的维度。
我们如何测试
- **为什么选择 OfficeQA。**它很像我们的用户带到 Energent 上的工作:找到正确的文档,从密集的表格中提取数字,将它们组合起来,并返回一个可以核验的精确答案。
- **同一个智能体,只更换模型。**Energent 智能体与模型无关。相同的工具、提示词和步数预算,在两个版本上运行了来自 Anthropic、OpenAI 和 Google 的七个前沿模型。更难的数据是导致下滑的原因;在智能体固定不变的情况下,各模型下滑幅度的差异归因于模型本身,而非智能体。
- **对每个模型采用相同规则。**每个答案都由基准测试的官方评分器评分,每个模型运行一次。
结果
准确率,从 v1 到 v2
官方评分器下的答案准确率,按 v2 分数排序。
| 模型 | v1(133 题) | v2(90 题) | 变化 |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- 在 v1 上,七个模型中有五个落在 7 分的区间内;在 v2 上,同样这七个模型的跨度达到 31 分。
- 保持稳定的两个模型 Fable 5.1 和 GPT-5.6 Sol 在 v1 上处于中游,在 v2 上则分列第一和第二。
v1:成本与推理概况
| 模型 | 每题成本 | 平均时长 | 每题模型调用数 | 每题工具调用数 | 每次调用的工具数 |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 分钟 | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 分钟 | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 分钟 | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 分钟 | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 分钟 | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 分钟 | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 分钟 | 12.3 | 14.0 | 1.14 |
v2:成本与推理概况
| 模型 | 每题成本 | 平均时长 | 每题模型调用数 | 每题工具调用数 | 每次调用的工具数 |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 分钟 | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 分钟 | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 分钟 | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 分钟 | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 分钟 | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 分钟 | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 分钟 | 25.9 | 33.0 | 1.27 |
- 每个模型在 v2 上都付出了更多:每题成本为原来的 2 到 3.4 倍,模型和工具调用数为原来的 1.5 到 2.6 倍,耗时为原来的 1.9 到 4.1 倍。
- 保持稳定的两个模型走了不同的路:Fable 5.1 的工具调用数在所有模型中最少,每题 3.2 分钟;GPT-5.6 Sol 的工具调用数最多,每题 6.9 分钟。
结论
OfficeQA 的两个版本提供了一种难得的东西:同一任务的两个难度级别,让您可以看到随着任务变难,哪些模型能够持续发挥,哪些模型会下滑。在 v1 上,七个模型挤在一起;在 v2 上,它们被远远拉开。简单的数据掩盖了模型之间的差异,困难的数据则将其暴露出来。
对 Energent 用户而言,这个选择由我们持续替您做出:随着您的任务变难,我们会在您这类工作上测量各个模型,选出经得住考验的那一个,并在准确率与速度和成本之间取得平衡,您无需进行任何配置。
致谢
特别感谢 Databricks 团队推出 OfficeQA:一个原始、高质量且刻意加大难度的数据集,基于真实文档构建,题目经过仔细核验,并以同一任务的两个版本发布。正是这种延续性让我们得以看到这一趋势。关于这些结果的详细论文正在撰写中。
参考资料
- Databricks,介绍 OfficeQA,第一版公告
- Databricks,介绍 OfficeQA Pro V2,第二版公告
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning,arXiv 2603.08655
- GitHub 上的 OfficeQA 代码库
- Hugging Face 上的 OfficeQA Pro V2 数据集
