Høydepunkter
NyheterBenchmark

Vanskeligere data, samme agent: hvor mye hver modell falt

Vanskeligere OfficeQA-data fra Databricks, samme Energent-agent, sju ledende modeller: Fable 5.1 og GPT-5.6 Sol holdt seg innenfor 3 poeng, de fem andre falt med 6 til 29.

Energent-teamet
Diagram med fallpiler for sju modeller fra OfficeQA v1 til v2: Fable 5.1 og GPT-5.6 Sol holdt seg, fem andre falt
Åpne diagrammet i full oppløsning

Databricks gjorde OfficeQA vanskeligere med en andre utgave. Vi holdt Energent-agenten uendret og sammenlignet de samme modellene på begge utgavene. Pilene i diagrammet ovenfor viser hva hver modell tapte mellom utgavene.

Kort fortalt

  • To modeller holdt seg: Fable 5.1 (72.2% → 70.0%) og GPT-5.6 Sol (71.4% → 68.9%). Fem falt med 6.5 til 28.8 poeng.
  • Rangeringen ble stokket om. Opus 5 ledet v1 med 74.4% og falt til tredjeplass; Sonnet 5 gikk fra 67.7% til 38.9%, fra femteplass til sisteplass.
  • «Vanskeligere» er målbart: 2× så stort korpus (697 → 1,435 dokumenter), 3.7× så mange siterte dokumenter per spørsmål (1.8 → 6.7) og omtrent 9× så mye tekst å lese per spørsmål (≈1 MB → ≈9 MB).
  • For Energent-brukere er det ingenting å konfigurere: agenten er modellagnostisk, så etter hvert som oppgavene dine vokser, måler vi, velger modellen som holder seg, og sikrer deg best mulig ytelse og hastighet.

Bakgrunn: OfficeQA, v1 til v2

OfficeQA er Databricks' benchmark for forankret resonnering over finansrapporter fra det amerikanske finansdepartementet (U.S. Treasury). v1 her er OfficeQA Pro, introdusert i den første kunngjøringen: de 133 spørsmålene som er merket som vanskelige i den opprinnelige benchmarken, over 697 Treasury Bulletins, skrevet for hånd av menneskelige annotatorer.

v2 er OfficeQA Pro V2, introdusert i den andre kunngjøringen: 90 spørsmål over 1,435 skannede regnskapsbøker over føderale inntekter og utgifter fra 1793 til 2024.

Side om side er v2 vanskeligere på hver akse som betyr noe for en agent:

v1v2Endring
Dokumenter i korpuset6971,435
Siterte dokumenter per spørsmål (gjennomsnitt)1.86.73.7×
Tekst å lese per spørsmål (gjennomsnitt)≈1 MB≈9 MB≈9×

Få benchmarker får en andre utgave av samme oppgave. Det fikk OfficeQA, og det gjør vanskelighetsgrad til en akse man kan måle langs.

Slik testet vi

  • Hvorfor OfficeQA. Det ligner arbeidet brukerne våre tar med til Energent: finne de riktige dokumentene, hente tall ut av tette tabeller, kombinere dem og levere et eksakt svar som kan kontrolleres.
  • Samme agent, bare modellen byttet. Energent-agenten er modellagnostisk. De samme verktøyene, promptene og stegbudsjettet kjørte sju ledende modeller fra Anthropic, OpenAI og Google på begge utgavene. Det er de vanskeligere dataene som driver fallet; med agenten uendret skyldes forskjellene mellom modellene i hvor mye de falt, modellen og ikke agenten.
  • Samme regler for hver modell. Hvert svar poengsettes av benchmarkens offisielle scorer, én kjøring per modell.

Resultater

Nøyaktighet, v1 til v2

Svarnøyaktighet under den offisielle scoreren, sortert etter v2-poengsummen.

Modellv1 (133 spm.)v2 (90 spm.)Endring
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • På v1 lå fem av de sju modellene innenfor et bånd på 7 poeng; på v2 spenner de samme sju over 31 poeng.
  • De to som holdt seg, Fable 5.1 og GPT-5.6 Sol, lå midt i feltet på v1 og ender som nummer én og to på v2.

v1: kostnad og inferensprofil

ModellKostnad / spørsmålSnittvarighetModellkall / spm.Verktøykall / spm.Verktøy per kall
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: kostnad og inferensprofil

ModellKostnad / spørsmålSnittvarighetModellkall / spm.Verktøykall / spm.Verktøy per kall
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Hver modell jobbet hardere på v2: 2 til 3.4 ganger kostnaden per spørsmål, 1.5 til 2.6 ganger så mange modell- og verktøykall, og 1.9 til 4.1 ganger så lang tid.
  • De to som holdt seg, gjorde det på hver sin måte: Fable 5.1 med færrest verktøykall av alle modellene og 3.2 minutter per spørsmål, GPT-5.6 Sol med flest verktøykall og 6.9 minutter.

Konklusjon

De to utgavene av OfficeQA tilbyr noe sjeldent: samme oppgave på to vanskelighetsnivåer, slik at man kan se hvilke modeller som fortsetter å levere når oppgaven blir vanskeligere, og hvilke som faller. På v1 lå de sju modellene tett samlet; på v2 spredte de seg langt fra hverandre. Enkle data skjuler forskjellene mellom modeller, vanskelige data avdekker dem.

For Energent-brukere er det et valg vi fortsetter å ta: etter hvert som oppgavene dine blir vanskeligere, måler vi modellene på din type arbeid, velger den som holder seg, og veier nøyaktighet mot hastighet og kostnad, uten at du trenger å konfigurere noe.

Takk

En spesiell takk til Databricks-teamet for OfficeQA: et rått datasett av høy kvalitet som bevisst er gjort vanskeligere, bygget på ekte dokumenter med nøye verifiserte spørsmål og utgitt i to utgaver av samme oppgave. Det er den kontinuiteten som i det hele tatt lot oss se denne trenden. En detaljert artikkel om disse resultatene er under utarbeidelse.

Referanser

  1. Databricks, Introducing OfficeQA, kunngjøringen av første utgave
  2. Databricks, Introducing OfficeQA Pro V2, kunngjøringen av andre utgave
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. OfficeQA-repositoriet på GitHub
  5. OfficeQA Pro V2-datasettet på Hugging Face

Løsninger

Maskinvare

KI-assisterte CAD-gjennomganger og arbeidsflyter for ingeniørdesign.