Databricks heeft OfficeQA moeilijker gemaakt met een tweede editie. Wij hielden de Energent-agent ongewijzigd en vergeleken dezelfde modellen op beide edities. De pijlen in de grafiek hierboven laten zien wat elk model tussen de edities verloor.
Samenvatting
- Twee modellen hielden stand: Fable 5.1 (72.2% → 70.0%) en GPT-5.6 Sol (71.4% → 68.9%). Vijf vielen 6.5 tot 28.8 punten terug.
- De rangorde is door elkaar geschud. Opus 5 leidde v1 met 74.4% en zakte naar de derde plaats; Sonnet 5 ging van 67.7% naar 38.9%, van de vijfde naar de laatste plaats.
- "Moeilijker" is meetbaar: 2× het corpus (697 → 1,435 documenten), 3.7× het aantal geciteerde documenten per vraag (1.8 → 6.7) en ongeveer 9× de te lezen tekst per vraag (≈1 MB → ≈9 MB).
- Voor Energent-gebruikers valt er niets te configureren: de agent is modelonafhankelijk, dus naarmate je taken groeien meten wij, kiezen we het model dat standhoudt en behouden we voor jou de beste prestaties en snelheid.
Achtergrond: OfficeQA, v1 naar v2
OfficeQA is de benchmark van Databricks voor gefundeerd redeneren over financiële rapporten van het Amerikaanse ministerie van Financiën. v1 is hier OfficeQA Pro, geïntroduceerd in de eerste aankondiging: de 133 vragen die in de oorspronkelijke benchmark als moeilijk zijn gelabeld, over 697 Treasury Bulletins, met de hand geschreven door menselijke annotatoren.
v2 is OfficeQA Pro V2, geïntroduceerd in de tweede aankondiging: 90 vragen over 1,435 gescande grootboeken van federale ontvangsten en uitgaven van 1793 tot 2024.
Naast elkaar gezet is v2 moeilijker op elke as die ertoe doet voor een agent:
| v1 | v2 | Verandering | |
|---|---|---|---|
| Documenten in het corpus | 697 | 1,435 | 2× |
| Geciteerde documenten per vraag (gemiddeld) | 1.8 | 6.7 | 3.7× |
| Te lezen tekst per vraag (gemiddeld) | ≈1 MB | ≈9 MB | ≈9× |
Weinig benchmarks krijgen een tweede editie van dezelfde taak. OfficeQA wel, en dat maakt moeilijkheid een as waarlangs je kunt meten.
Hoe we hebben getest
- Waarom OfficeQA. Het lijkt op het werk dat onze gebruikers naar Energent brengen: de juiste documenten vinden, cijfers uit dichte tabellen halen, ze combineren en een exact antwoord teruggeven dat controleerbaar is.
- Dezelfde agent, alleen het model gewisseld. De Energent-agent is modelonafhankelijk. Dezelfde tools, prompts en stappenbudget draaiden zeven frontier-modellen van Anthropic, OpenAI en Google op beide edities. De moeilijkere data veroorzaakt de daling; met een ongewijzigde agent zijn de verschillen tussen modellen in hoe ver ze terugvielen toe te schrijven aan het model, niet aan de agent.
- Dezelfde regels voor elk model. Elk antwoord wordt beoordeeld door de officiële scorer van de benchmark, één run per model.
Resultaten
Nauwkeurigheid, v1 naar v2
Antwoordnauwkeurigheid volgens de officiële scorer, gesorteerd op de v2-score.
| Model | v1 (133 vragen) | v2 (90 vragen) | Verandering |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Op v1 zaten vijf van de zeven modellen binnen een band van 7 punten; op v2 beslaan dezelfde zeven 31 punten.
- De twee die standhielden, Fable 5.1 en GPT-5.6 Sol, zaten op v1 in de middenmoot en eindigen op v2 als eerste en tweede.
v1: kosten- en inferentieprofiel
| Model | Kosten / vraag | Gem. duur | Modelaanroepen / vraag | Toolaanroepen / vraag | Tools per aanroep |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: kosten- en inferentieprofiel
| Model | Kosten / vraag | Gem. duur | Modelaanroepen / vraag | Toolaanroepen / vraag | Tools per aanroep |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Elk model werkte harder op v2: 2 tot 3.4 keer de kosten per vraag, 1.5 tot 2.6 keer zoveel model- en toolaanroepen en 1.9 tot 4.1 keer zo lang.
- De twee die standhielden deden dat op verschillende manieren: Fable 5.1 met de minste toolaanroepen van alle modellen en 3.2 minuten per vraag, GPT-5.6 Sol met de meeste toolaanroepen en 6.9 minuten.
Conclusie
De twee edities van OfficeQA bieden iets zeldzaams: dezelfde taak op twee moeilijkheidsniveaus, zodat je kunt zien welke modellen blijven presteren naarmate de taak moeilijker wordt en welke terugvallen. Op v1 zaten de zeven modellen dicht bij elkaar; op v2 liggen ze ver uit elkaar. Makkelijke data verbergt de verschillen tussen modellen, moeilijke data legt ze bloot.
Voor Energent-gebruikers blijft die keuze aan ons: naarmate je taken moeilijker worden, meten wij de modellen op jouw soort werk, kiezen we het model dat standhoudt en wegen we nauwkeurigheid af tegen snelheid en kosten, zonder dat je iets hoeft te configureren.
Dankwoord
Onze bijzondere dank gaat uit naar het Databricks-team voor OfficeQA: een rauwe, hoogwaardige en bewust moeilijkere dataset, gebouwd op echte documenten met zorgvuldig geverifieerde vragen, en uitgebracht in twee edities van dezelfde taak. Die continuïteit is wat ons deze trend überhaupt liet zien. Een gedetailleerd paper over deze resultaten is in voorbereiding.
Referenties
- Databricks, Introductie van OfficeQA, de aankondiging van de eerste editie
- Databricks, Introductie van OfficeQA Pro V2, de aankondiging van de tweede editie
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- OfficeQA-repository op GitHub
- OfficeQA Pro V2-dataset op Hugging Face
