Databricks gjorde OfficeQA sværere med en anden udgave. Vi holdt Energent-agenten uændret og sammenlignede de samme modeller på begge udgaver. Pilene i diagrammet ovenfor viser, hvad hver model tabte mellem udgaverne.
Kort fortalt
- To modeller holdt stand: Fable 5.1 (72.2% → 70.0%) og GPT-5.6 Sol (71.4% → 68.9%). Fem faldt med 6.5 til 28.8 point.
- Rangordenen blev byttet om. Opus 5 førte v1 med 74.4% og faldt til tredjepladsen; Sonnet 5 gik fra 67.7% til 38.9%, fra femte- til sidstepladsen.
- "Sværere" kan måles: 2× så stort et korpus (697 → 1,435 dokumenter), 3.7× så mange citerede dokumenter pr. spørgsmål (1.8 → 6.7) og omkring 9× så meget tekst at læse pr. spørgsmål (≈1 MB → ≈9 MB).
- For Energent-brugere er der intet at konfigurere: agenten er modelagnostisk, så efterhånden som dine opgaver vokser, måler vi, vælger den model, der holder, og sikrer dig den bedste ydelse og hastighed.
Baggrund: OfficeQA, v1 til v2
OfficeQA er Databricks' benchmark for forankret ræsonnement over finansrapporter fra det amerikanske finansministerium. v1 er her OfficeQA Pro, introduceret i den første annoncering: de 133 spørgsmål, der er mærket som svære i det oprindelige benchmark, over 697 Treasury Bulletins, skrevet i hånden af menneskelige annotatører.
v2 er OfficeQA Pro V2, introduceret i den anden annoncering: 90 spørgsmål over 1,435 scannede regnskabsbøger over føderale indtægter og udgifter fra 1793 til 2024.
Side om side er v2 sværere på hver eneste akse, der betyder noget for en agent:
| v1 | v2 | Ændring | |
|---|---|---|---|
| Dokumenter i korpusset | 697 | 1,435 | 2× |
| Citerede dokumenter pr. spørgsmål (gennemsnit) | 1.8 | 6.7 | 3.7× |
| Tekst at læse pr. spørgsmål (gennemsnit) | ≈1 MB | ≈9 MB | ≈9× |
Få benchmarks får en anden udgave af den samme opgave. Det fik OfficeQA, og det gør sværhedsgrad til en akse, man kan måle langs.
Sådan testede vi
- Hvorfor OfficeQA. Det ligner det arbejde, vores brugere kommer til Energent med: find de rigtige dokumenter, træk tal ud af tætpakkede tabeller, kombiner dem, og lever et præcist svar, der kan kontrolleres.
- Samme agent, kun modellen skiftet ud. Energent-agenten er modelagnostisk. De samme værktøjer, prompts og trinbudget kørte syv frontier-modeller fra Anthropic, OpenAI og Google på begge udgaver. Det er de sværere data, der driver faldet; med agenten uændret skyldes forskellene mellem modellerne i, hvor meget de faldt, modellen og ikke agenten.
- Samme regler for alle modeller. Hvert svar bedømmes af benchmarkets officielle scorer, én kørsel pr. model.
Resultater
Nøjagtighed, v1 til v2
Svarnøjagtighed under den officielle scorer, sorteret efter v2-score.
| Model | v1 (133 spm.) | v2 (90 spm.) | Ændring |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- På v1 lå fem af de syv modeller inden for et bånd på 7 point; på v2 spænder de samme syv over 31 point.
- De to, der holdt stand, Fable 5.1 og GPT-5.6 Sol, lå midt i feltet på v1 og ender som nummer et og to på v2.
v1: omkostnings- og inferensprofil
| Model | Omkostning / spørgsmål | Gns. varighed | Modelkald / spm. | Værktøjskald / spm. | Værktøjer pr. kald |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: omkostnings- og inferensprofil
| Model | Omkostning / spørgsmål | Gns. varighed | Modelkald / spm. | Værktøjskald / spm. | Værktøjer pr. kald |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Alle modeller arbejdede hårdere på v2: 2 til 3.4 gange omkostningen pr. spørgsmål, 1.5 til 2.6 gange så mange model- og værktøjskald og 1.9 til 4.1 gange så lang tid.
- De to, der holdt stand, gjorde det forskelligt: Fable 5.1 med de færreste værktøjskald af alle modeller og 3.2 minutter pr. spørgsmål, GPT-5.6 Sol med de fleste værktøjskald og 6.9 minutter.
Konklusion
De to udgaver af OfficeQA tilbyder noget sjældent: den samme opgave på to sværhedsniveauer, så man kan se, hvilke modeller der bliver ved med at levere, når opgaven bliver sværere, og hvilke der falder. På v1 lå de syv modeller tæt samlet; på v2 spredte de sig langt fra hinanden. Lette data skjuler forskellene mellem modellerne, svære data afslører dem.
For Energent-brugere er det valg fortsat vores at træffe: efterhånden som dine opgaver bliver sværere, måler vi modellerne på din type arbejde, vælger den, der holder, og afvejer nøjagtighed mod hastighed og omkostninger, uden at du skal konfigurere noget.
Tak
En særlig tak til Databricks-teamet for OfficeQA: et råt datasæt af høj kvalitet, der bevidst er gjort sværere, bygget på rigtige dokumenter med omhyggeligt verificerede spørgsmål og udgivet i to udgaver af den samme opgave. Det er den kontinuitet, der overhovedet lod os se denne tendens. En detaljeret artikel om disse resultater er under udarbejdelse.
Referencer
- Databricks, Vi præsenterer OfficeQA, annonceringen af første udgave
- Databricks, Vi præsenterer OfficeQA Pro V2, annonceringen af anden udgave
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- OfficeQA-repository på GitHub
- OfficeQA Pro V2-datasæt på Hugging Face
