Databricks gjorde OfficeQA vanskeligere med en andre utgave. Vi holdt Energent-agenten uendret og sammenlignet de samme modellene på begge utgavene. Pilene i diagrammet ovenfor viser hva hver modell tapte mellom utgavene.
Kort fortalt
- To modeller holdt seg: Fable 5.1 (72.2% → 70.0%) og GPT-5.6 Sol (71.4% → 68.9%). Fem falt med 6.5 til 28.8 poeng.
- Rangeringen ble stokket om. Opus 5 ledet v1 med 74.4% og falt til tredjeplass; Sonnet 5 gikk fra 67.7% til 38.9%, fra femteplass til sisteplass.
- «Vanskeligere» er målbart: 2× så stort korpus (697 → 1,435 dokumenter), 3.7× så mange siterte dokumenter per spørsmål (1.8 → 6.7) og omtrent 9× så mye tekst å lese per spørsmål (≈1 MB → ≈9 MB).
- For Energent-brukere er det ingenting å konfigurere: agenten er modellagnostisk, så etter hvert som oppgavene dine vokser, måler vi, velger modellen som holder seg, og sikrer deg best mulig ytelse og hastighet.
Bakgrunn: OfficeQA, v1 til v2
OfficeQA er Databricks' benchmark for forankret resonnering over finansrapporter fra det amerikanske finansdepartementet (U.S. Treasury). v1 her er OfficeQA Pro, introdusert i den første kunngjøringen: de 133 spørsmålene som er merket som vanskelige i den opprinnelige benchmarken, over 697 Treasury Bulletins, skrevet for hånd av menneskelige annotatorer.
v2 er OfficeQA Pro V2, introdusert i den andre kunngjøringen: 90 spørsmål over 1,435 skannede regnskapsbøker over føderale inntekter og utgifter fra 1793 til 2024.
Side om side er v2 vanskeligere på hver akse som betyr noe for en agent:
| v1 | v2 | Endring | |
|---|---|---|---|
| Dokumenter i korpuset | 697 | 1,435 | 2× |
| Siterte dokumenter per spørsmål (gjennomsnitt) | 1.8 | 6.7 | 3.7× |
| Tekst å lese per spørsmål (gjennomsnitt) | ≈1 MB | ≈9 MB | ≈9× |
Få benchmarker får en andre utgave av samme oppgave. Det fikk OfficeQA, og det gjør vanskelighetsgrad til en akse man kan måle langs.
Slik testet vi
- Hvorfor OfficeQA. Det ligner arbeidet brukerne våre tar med til Energent: finne de riktige dokumentene, hente tall ut av tette tabeller, kombinere dem og levere et eksakt svar som kan kontrolleres.
- Samme agent, bare modellen byttet. Energent-agenten er modellagnostisk. De samme verktøyene, promptene og stegbudsjettet kjørte sju ledende modeller fra Anthropic, OpenAI og Google på begge utgavene. Det er de vanskeligere dataene som driver fallet; med agenten uendret skyldes forskjellene mellom modellene i hvor mye de falt, modellen og ikke agenten.
- Samme regler for hver modell. Hvert svar poengsettes av benchmarkens offisielle scorer, én kjøring per modell.
Resultater
Nøyaktighet, v1 til v2
Svarnøyaktighet under den offisielle scoreren, sortert etter v2-poengsummen.
| Modell | v1 (133 spm.) | v2 (90 spm.) | Endring |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- På v1 lå fem av de sju modellene innenfor et bånd på 7 poeng; på v2 spenner de samme sju over 31 poeng.
- De to som holdt seg, Fable 5.1 og GPT-5.6 Sol, lå midt i feltet på v1 og ender som nummer én og to på v2.
v1: kostnad og inferensprofil
| Modell | Kostnad / spørsmål | Snittvarighet | Modellkall / spm. | Verktøykall / spm. | Verktøy per kall |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: kostnad og inferensprofil
| Modell | Kostnad / spørsmål | Snittvarighet | Modellkall / spm. | Verktøykall / spm. | Verktøy per kall |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Hver modell jobbet hardere på v2: 2 til 3.4 ganger kostnaden per spørsmål, 1.5 til 2.6 ganger så mange modell- og verktøykall, og 1.9 til 4.1 ganger så lang tid.
- De to som holdt seg, gjorde det på hver sin måte: Fable 5.1 med færrest verktøykall av alle modellene og 3.2 minutter per spørsmål, GPT-5.6 Sol med flest verktøykall og 6.9 minutter.
Konklusjon
De to utgavene av OfficeQA tilbyr noe sjeldent: samme oppgave på to vanskelighetsnivåer, slik at man kan se hvilke modeller som fortsetter å levere når oppgaven blir vanskeligere, og hvilke som faller. På v1 lå de sju modellene tett samlet; på v2 spredte de seg langt fra hverandre. Enkle data skjuler forskjellene mellom modeller, vanskelige data avdekker dem.
For Energent-brukere er det et valg vi fortsetter å ta: etter hvert som oppgavene dine blir vanskeligere, måler vi modellene på din type arbeid, velger den som holder seg, og veier nøyaktighet mot hastighet og kostnad, uten at du trenger å konfigurere noe.
Takk
En spesiell takk til Databricks-teamet for OfficeQA: et rått datasett av høy kvalitet som bevisst er gjort vanskeligere, bygget på ekte dokumenter med nøye verifiserte spørsmål og utgitt i to utgaver av samme oppgave. Det er den kontinuiteten som i det hele tatt lot oss se denne trenden. En detaljert artikkel om disse resultatene er under utarbeidelse.
Referanser
- Databricks, Introducing OfficeQA, kunngjøringen av første utgave
- Databricks, Introducing OfficeQA Pro V2, kunngjøringen av andre utgave
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- OfficeQA-repositoriet på GitHub
- OfficeQA Pro V2-datasettet på Hugging Face
