Kiemelések
BejelentésekBenchmark

Nehezebb adatok, ugyanaz az ügynök: mennyit esett vissza egy-egy modell

Nehezebb Databricks OfficeQA-adatok, ugyanaz az Energent-ügynök, hét élvonalbeli modell: a Fable 5.1 és a GPT-5.6 Sol 3 ponton belül tartotta magát, a másik öt 6 és 29 pont között esett vissza.

Energent csapat
Hét modell visszaesését nyilakkal ábrázoló diagram az OfficeQA v1-ről v2-re: a Fable 5.1 és a GPT-5.6 Sol tartotta magát, öt másik visszaesett
Diagram megnyitása teljes felbontásban

A Databricks egy második kiadással nehezebbé tette az OfficeQA-t. Az Energent-ügynököt változatlanul hagytuk, és ugyanazokat a modelleket hasonlítottuk össze mindkét kiadáson. A fenti diagram nyilai azt mutatják, mennyit veszített egy-egy modell a két kiadás között.

Röviden

  • Két modell tartotta magát: a Fable 5.1 (72.2% → 70.0%) és a GPT-5.6 Sol (71.4% → 68.9%). Öt modell 6.5 és 28.8 pont között esett vissza.
  • A rangsor átrendeződött. Az Opus 5 74.4%-kal vezette a v1-et, majd a harmadik helyre csúszott; a Sonnet 5 67.7%-ról 38.9%-ra esett, az ötödik helyről az utolsóra.
  • A „nehezebb” mérhető: 2× akkora korpusz (697 → 1,435 dokumentum), 3.7× annyi hivatkozott dokumentum kérdésenként (1.8 → 6.7), és nagyjából 9× annyi elolvasandó szöveg kérdésenként (≈1 MB → ≈9 MB).
  • Az Energent felhasználóinak nincs mit beállítaniuk: az ügynök modellfüggetlen, így ahogy a feladataik nőnek, mi mérünk, kiválasztjuk azt a modellt, amelyik tartja magát, és megtartjuk számukra a legjobb teljesítményt és sebességet.

Háttér: OfficeQA, v1-ről v2-re

Az OfficeQA a Databricks benchmarkja az Egyesült Államok Pénzügyminisztériumának pénzügyi jelentésein végzett forrásalapú érveléshez. A v1 itt az OfficeQA Pro, amelyet az első bejelentés mutatott be: az eredeti benchmark 133, nehéznek jelölt kérdése 697 Treasury Bulletin fölött, emberi annotátorok által kézzel megírva.

A v2 az OfficeQA Pro V2, amelyet a második bejelentés mutatott be: 90 kérdés a szövetségi bevételek és kiadások 1,435 beszkennelt főkönyve fölött, 1793-tól 2024-ig.

Egymás mellé állítva a v2 minden, egy ügynök számára lényeges tengelyen nehezebb:

v1v2Változás
Dokumentumok a korpuszban6971,435
Hivatkozott dokumentumok kérdésenként (átlag)1.86.73.7×
Elolvasandó szöveg kérdésenként (átlag)≈1 MB≈9 MB≈9×

Kevés benchmark kap második kiadást ugyanabból a feladatból. Az OfficeQA kapott, így a nehézség olyan tengellyé válik, amely mentén mérni lehet.

Hogyan teszteltünk

  • Miért az OfficeQA. Hasonlít arra a munkára, amelyet a felhasználóink az Energentre bíznak: megtalálni a megfelelő dokumentumokat, számokat kinyerni sűrű táblázatokból, ezeket összekapcsolni, és ellenőrizhető, pontos választ adni.
  • Ugyanaz az ügynök, csak a modell cserélődött. Az Energent-ügynök modellfüggetlen. Ugyanazok az eszközök, promptok és lépéskeret futtatták az Anthropic, az OpenAI és a Google hét élvonalbeli modelljét mindkét kiadáson. A visszaesést a nehezebb adat okozza; rögzített ügynök mellett a modellek közötti különbség abban, hogy mennyit estek, a modellen múlik, nem az ügynökön.
  • Ugyanazok a szabályok minden modellre. Minden választ a benchmark hivatalos pontozója értékel, modellenként egy futással.

Eredmények

Pontosság, v1-ről v2-re

Válaszpontosság a hivatalos pontozó szerint, a v2-pontszám alapján rendezve.

Modellv1 (133 kérdés)v2 (90 kérdés)Változás
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • A v1-en a hét modellből öt egy 7 pontos sávban helyezkedett el; a v2-n ugyanez a hét modell 31 pontot fog át.
  • A két helytálló modell, a Fable 5.1 és a GPT-5.6 Sol, a v1-en a középmezőnyben volt, a v2-n pedig az első és a második helyen végzett.

v1: költség- és inferenciaprofil

ModellKöltség / kérdésÁtl. időtartamModellhívás / kérdésEszközhívás / kérdésEszköz hívásonként
Fable 5.1$0.581.7 perc11.610.70.93
GPT-5.6 Sol$0.732.3 perc13.623.91.76
Opus 5$0.491.4 perc9.711.61.20
Fable 5$0.941.6 perc8.511.01.29
GPT-5.6 Terra$0.261.7 perc13.721.61.58
Gemini 3.1 Pro$0.301.3 perc17.816.20.91
Sonnet 5$0.282.2 perc12.314.01.14

v2: költség- és inferenciaprofil

ModellKöltség / kérdésÁtl. időtartamModellhívás / kérdésEszközhívás / kérdésEszköz hívásonként
Fable 5.1$1.243.2 perc18.117.60.97
GPT-5.6 Sol$2.126.9 perc24.361.92.55
Opus 5$0.982.7 perc17.019.41.14
Fable 5$2.004.0 perc14.819.51.31
GPT-5.6 Terra$0.633.8 perc20.743.42.10
Gemini 3.1 Pro$1.015.3 perc38.436.90.96
Sonnet 5$0.837.0 perc25.933.01.27
  • Minden modell keményebben dolgozott a v2-n: a kérdésenkénti költség 2–3.4-szeresére, a modell- és eszközhívások száma 1.5–2.6-szorosára, az időtartam pedig 1.9–4.1-szeresére nőtt.
  • A két helytálló modell másképp érte ezt el: a Fable 5.1 az összes modell közül a legkevesebb eszközhívással és kérdésenként 3.2 perccel, a GPT-5.6 Sol a legtöbb eszközhívással és 6.9 perccel.

Következtetés

Az OfficeQA két kiadása valami ritkát kínál: ugyanazt a feladatot két nehézségi szinten, így látható, mely modellek teljesítenek továbbra is a feladat nehezedésével, és melyek esnek vissza. A v1-en a hét modell szorosan együtt volt; a v2-n messze szétszóródtak. A könnyű adat elrejti a modellek közötti különbségeket, a nehéz adat felszínre hozza őket.

Az Energent felhasználói számára ezt a választást mi hozzuk meg újra és újra: ahogy a feladataik nehezednek, az ő munkatípusukon mérjük a modelleket, kiválasztjuk azt, amelyik tartja magát, és egyensúlyt teremtünk a pontosság, a sebesség és a költség között, anélkül hogy nekik bármit be kellene állítaniuk.

Köszönet

Külön köszönet a Databricks csapatának az OfficeQA-ért: egy nyers, kiváló minőségű és szándékosan nehezebb adatkészletért, amely valódi dokumentumokra épül, gondosan ellenőrzött kérdésekkel, és amely ugyanabból a feladatból két kiadásban jelent meg. Ez a folytonosság tette egyáltalán lehetővé, hogy ezt a trendet lássuk. Az eredményekről részletes tanulmány készül.

Hivatkozások

  1. Databricks, Az OfficeQA bemutatása, az első kiadás bejelentése
  2. Databricks, Az OfficeQA Pro V2 bemutatása, a második kiadás bejelentése
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Az OfficeQA repository a GitHubon
  5. Az OfficeQA Pro V2 adatkészlet a Hugging Face-en

Megoldások

Hardver

AI-támogatott CAD-ellenőrzések és mérnöki tervezési munkafolyamatok.