Højdepunkter
NyhederBenchmark

Sværere data, samme agent: så meget faldt hver model

Sværere OfficeQA-data fra Databricks, samme Energent-agent, syv frontier-modeller: Fable 5.1 og GPT-5.6 Sol holdt sig inden for 3 point, de fem andre faldt med 6 til 29.

Energent-teamet
Pilediagram over syv modellers fald fra OfficeQA v1 til v2: Fable 5.1 og GPT-5.6 Sol holdt stand, fem andre faldt
Åbn diagrammet i fuld opløsning

Databricks gjorde OfficeQA sværere med en anden udgave. Vi holdt Energent-agenten uændret og sammenlignede de samme modeller på begge udgaver. Pilene i diagrammet ovenfor viser, hvad hver model tabte mellem udgaverne.

Kort fortalt

  • To modeller holdt stand: Fable 5.1 (72.2% → 70.0%) og GPT-5.6 Sol (71.4% → 68.9%). Fem faldt med 6.5 til 28.8 point.
  • Rangordenen blev byttet om. Opus 5 førte v1 med 74.4% og faldt til tredjepladsen; Sonnet 5 gik fra 67.7% til 38.9%, fra femte- til sidstepladsen.
  • "Sværere" kan måles: 2× så stort et korpus (697 → 1,435 dokumenter), 3.7× så mange citerede dokumenter pr. spørgsmål (1.8 → 6.7) og omkring 9× så meget tekst at læse pr. spørgsmål (≈1 MB → ≈9 MB).
  • For Energent-brugere er der intet at konfigurere: agenten er modelagnostisk, så efterhånden som dine opgaver vokser, måler vi, vælger den model, der holder, og sikrer dig den bedste ydelse og hastighed.

Baggrund: OfficeQA, v1 til v2

OfficeQA er Databricks' benchmark for forankret ræsonnement over finansrapporter fra det amerikanske finansministerium. v1 er her OfficeQA Pro, introduceret i den første annoncering: de 133 spørgsmål, der er mærket som svære i det oprindelige benchmark, over 697 Treasury Bulletins, skrevet i hånden af menneskelige annotatører.

v2 er OfficeQA Pro V2, introduceret i den anden annoncering: 90 spørgsmål over 1,435 scannede regnskabsbøger over føderale indtægter og udgifter fra 1793 til 2024.

Side om side er v2 sværere på hver eneste akse, der betyder noget for en agent:

v1v2Ændring
Dokumenter i korpusset6971,435
Citerede dokumenter pr. spørgsmål (gennemsnit)1.86.73.7×
Tekst at læse pr. spørgsmål (gennemsnit)≈1 MB≈9 MB≈9×

Få benchmarks får en anden udgave af den samme opgave. Det fik OfficeQA, og det gør sværhedsgrad til en akse, man kan måle langs.

Sådan testede vi

  • Hvorfor OfficeQA. Det ligner det arbejde, vores brugere kommer til Energent med: find de rigtige dokumenter, træk tal ud af tætpakkede tabeller, kombiner dem, og lever et præcist svar, der kan kontrolleres.
  • Samme agent, kun modellen skiftet ud. Energent-agenten er modelagnostisk. De samme værktøjer, prompts og trinbudget kørte syv frontier-modeller fra Anthropic, OpenAI og Google på begge udgaver. Det er de sværere data, der driver faldet; med agenten uændret skyldes forskellene mellem modellerne i, hvor meget de faldt, modellen og ikke agenten.
  • Samme regler for alle modeller. Hvert svar bedømmes af benchmarkets officielle scorer, én kørsel pr. model.

Resultater

Nøjagtighed, v1 til v2

Svarnøjagtighed under den officielle scorer, sorteret efter v2-score.

Modelv1 (133 spm.)v2 (90 spm.)Ændring
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • På v1 lå fem af de syv modeller inden for et bånd på 7 point; på v2 spænder de samme syv over 31 point.
  • De to, der holdt stand, Fable 5.1 og GPT-5.6 Sol, lå midt i feltet på v1 og ender som nummer et og to på v2.

v1: omkostnings- og inferensprofil

ModelOmkostning / spørgsmålGns. varighedModelkald / spm.Værktøjskald / spm.Værktøjer pr. kald
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: omkostnings- og inferensprofil

ModelOmkostning / spørgsmålGns. varighedModelkald / spm.Værktøjskald / spm.Værktøjer pr. kald
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Alle modeller arbejdede hårdere på v2: 2 til 3.4 gange omkostningen pr. spørgsmål, 1.5 til 2.6 gange så mange model- og værktøjskald og 1.9 til 4.1 gange så lang tid.
  • De to, der holdt stand, gjorde det forskelligt: Fable 5.1 med de færreste værktøjskald af alle modeller og 3.2 minutter pr. spørgsmål, GPT-5.6 Sol med de fleste værktøjskald og 6.9 minutter.

Konklusion

De to udgaver af OfficeQA tilbyder noget sjældent: den samme opgave på to sværhedsniveauer, så man kan se, hvilke modeller der bliver ved med at levere, når opgaven bliver sværere, og hvilke der falder. På v1 lå de syv modeller tæt samlet; på v2 spredte de sig langt fra hinanden. Lette data skjuler forskellene mellem modellerne, svære data afslører dem.

For Energent-brugere er det valg fortsat vores at træffe: efterhånden som dine opgaver bliver sværere, måler vi modellerne på din type arbejde, vælger den, der holder, og afvejer nøjagtighed mod hastighed og omkostninger, uden at du skal konfigurere noget.

Tak

En særlig tak til Databricks-teamet for OfficeQA: et råt datasæt af høj kvalitet, der bevidst er gjort sværere, bygget på rigtige dokumenter med omhyggeligt verificerede spørgsmål og udgivet i to udgaver af den samme opgave. Det er den kontinuitet, der overhovedet lod os se denne tendens. En detaljeret artikel om disse resultater er under udarbejdelse.

Referencer

  1. Databricks, Vi præsenterer OfficeQA, annonceringen af første udgave
  2. Databricks, Vi præsenterer OfficeQA Pro V2, annonceringen af anden udgave
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. OfficeQA-repository på GitHub
  5. OfficeQA Pro V2-datasæt på Hugging Face

Løsninger

Hardware

AI-assisterede CAD-gennemgange og ingeniørdesignarbejdsgange.