Höjdpunkter
NyheterBenchmark

Svårare data, samma agent: hur mycket varje modell föll

Svårare OfficeQA-data från Databricks, samma Energent-agent, sju frontier-modeller: Fable 5.1 och GPT-5.6 Sol höll sig inom 3 poäng, de övriga fem föll med 6 till 29.

Energent-teamet
Pildiagram över sju modeller från OfficeQA v1 till v2: Fable 5.1 och GPT-5.6 Sol höll, fem andra föll
Öppna diagrammet i full upplösning

Databricks gjorde OfficeQA svårare med en andra utgåva. Vi höll Energent-agenten oförändrad och jämförde samma modeller på båda utgåvorna. Pilarna i diagrammet ovan visar vad varje modell förlorade mellan utgåvorna.

Sammanfattning

  • Två modeller höll: Fable 5.1 (72.2% → 70.0%) och GPT-5.6 Sol (71.4% → 68.9%). Fem föll med 6.5 till 28.8 poäng.
  • Rangordningen kastades om. Opus 5 ledde v1 med 74.4% och föll till tredje plats; Sonnet 5 gick från 67.7% till 38.9%, från femte till sista plats.
  • ”Svårare” är mätbart: 2× så stor korpus (697 → 1,435 dokument), 3.7× så många citerade dokument per fråga (1.8 → 6.7) och ungefär 9× så mycket text att läsa per fråga (≈1 MB → ≈9 MB).
  • För Energent-användare finns inget att konfigurera: agenten är modellagnostisk, så när dina uppgifter växer mäter vi, väljer den modell som håller och behåller bästa prestanda och hastighet åt dig.

Bakgrund: OfficeQA, v1 till v2

OfficeQA är Databricks benchmark för grundat resonemang över finansiella rapporter från USA:s finansdepartement. v1 här är OfficeQA Pro, som introducerades i det första tillkännagivandet: de 133 frågor som märkts som svåra i det ursprungliga benchmarket, över 697 Treasury Bulletins, skrivna för hand av mänskliga annotatörer.

v2 är OfficeQA Pro V2, som introducerades i det andra tillkännagivandet: 90 frågor över 1,435 skannade räkenskapsböcker över federala inkomster och utgifter från 1793 till 2024.

Sida vid sida är v2 svårare på varje axel som spelar roll för en agent:

v1v2Förändring
Dokument i korpusen6971,435
Citerade dokument per fråga (medel)1.86.73.7×
Text att läsa per fråga (medel)≈1 MB≈9 MB≈9×

Få benchmarktester får en andra utgåva av samma uppgift. OfficeQA fick det, vilket gör svårighetsgrad till en axel som går att mäta längs.

Så testade vi

  • Varför OfficeQA. Det liknar det arbete våra användare tar med sig till Energent: hitta rätt dokument, plocka ut siffror ur täta tabeller, kombinera dem och ge ett exakt svar som går att kontrollera.
  • Samma agent, bara modellen utbytt. Energent-agenten är modellagnostisk. Samma verktyg, prompter och stegbudget körde sju frontier-modeller från Anthropic, OpenAI och Google på båda utgåvorna. Det är de svårare data som driver nedgången; med agenten oförändrad beror skillnaderna mellan modellerna i hur mycket de föll på modellen, inte på agenten.
  • Samma regler för varje modell. Varje svar poängsätts av benchmarkets officiella utvärderare, en körning per modell.

Resultat

Noggrannhet, v1 till v2

Svarsnoggrannhet enligt den officiella utvärderaren, sorterad efter v2-poängen.

Modellv1 (133 frågor)v2 (90 frågor)Förändring
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • På v1 låg fem av de sju modellerna inom ett spann på 7 poäng; på v2 sträcker sig samma sju över 31 poäng.
  • De två som höll, Fable 5.1 och GPT-5.6 Sol, låg i mitten av fältet på v1 och slutar som etta och tvåa på v2.

v1: kostnad och inferensprofil

ModellKostnad / frågaGenomsnittlig tidModellanrop / frågaVerktygsanrop / frågaVerktyg per anrop
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: kostnad och inferensprofil

ModellKostnad / frågaGenomsnittlig tidModellanrop / frågaVerktygsanrop / frågaVerktyg per anrop
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Varje modell arbetade hårdare på v2: 2 till 3.4 gånger kostnaden per fråga, 1.5 till 2.6 gånger så många modell- och verktygsanrop och 1.9 till 4.1 gånger så lång tid.
  • De två som höll gjorde det på olika sätt: Fable 5.1 med färst verktygsanrop av alla modeller och 3.2 minuter per fråga, GPT-5.6 Sol med flest verktygsanrop och 6.9 minuter.

Slutsats

OfficeQA:s två utgåvor erbjuder något sällsynt: samma uppgift på två svårighetsnivåer, så att man kan se vilka modeller som fortsätter prestera när uppgiften blir svårare och vilka som faller. På v1 låg de sju modellerna tätt samlade; på v2 spreds de långt isär. Enkla data döljer skillnaderna mellan modeller, svåra data blottlägger dem.

För Energent-användare är det ett val vi fortsätter att göra åt er: när dina uppgifter blir svårare mäter vi modellerna på din typ av arbete, väljer den som håller och väger noggrannhet mot hastighet och kostnad, utan att du behöver konfigurera något.

Tack

Ett särskilt tack till Databricks-teamet för OfficeQA: en rå, högkvalitativ och avsiktligt svårare datauppsättning, byggd på verkliga dokument med noggrant verifierade frågor och utgiven i två utgåvor av samma uppgift. Det är den kontinuiteten som över huvud taget lät oss se den här trenden. En detaljerad artikel om dessa resultat är under förberedelse.

Referenser

  1. Databricks, Vi presenterar OfficeQA, tillkännagivandet av den första utgåvan
  2. Databricks, Vi presenterar OfficeQA Pro V2, tillkännagivandet av den andra utgåvan
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. OfficeQA-repositoryt på GitHub
  5. Datauppsättningen OfficeQA Pro V2 på Hugging Face

Lösningar

Hårdvara

AI-assisterade CAD-granskningar och arbetsflöden för ingenjörsdesign.