A Databricks egy második kiadással nehezebbé tette az OfficeQA-t. Az Energent-ügynököt változatlanul hagytuk, és ugyanazokat a modelleket hasonlítottuk össze mindkét kiadáson. A fenti diagram nyilai azt mutatják, mennyit veszített egy-egy modell a két kiadás között.
Röviden
- Két modell tartotta magát: a Fable 5.1 (72.2% → 70.0%) és a GPT-5.6 Sol (71.4% → 68.9%). Öt modell 6.5 és 28.8 pont között esett vissza.
- A rangsor átrendeződött. Az Opus 5 74.4%-kal vezette a v1-et, majd a harmadik helyre csúszott; a Sonnet 5 67.7%-ról 38.9%-ra esett, az ötödik helyről az utolsóra.
- A „nehezebb” mérhető: 2× akkora korpusz (697 → 1,435 dokumentum), 3.7× annyi hivatkozott dokumentum kérdésenként (1.8 → 6.7), és nagyjából 9× annyi elolvasandó szöveg kérdésenként (≈1 MB → ≈9 MB).
- Az Energent felhasználóinak nincs mit beállítaniuk: az ügynök modellfüggetlen, így ahogy a feladataik nőnek, mi mérünk, kiválasztjuk azt a modellt, amelyik tartja magát, és megtartjuk számukra a legjobb teljesítményt és sebességet.
Háttér: OfficeQA, v1-ről v2-re
Az OfficeQA a Databricks benchmarkja az Egyesült Államok Pénzügyminisztériumának pénzügyi jelentésein végzett forrásalapú érveléshez. A v1 itt az OfficeQA Pro, amelyet az első bejelentés mutatott be: az eredeti benchmark 133, nehéznek jelölt kérdése 697 Treasury Bulletin fölött, emberi annotátorok által kézzel megírva.
A v2 az OfficeQA Pro V2, amelyet a második bejelentés mutatott be: 90 kérdés a szövetségi bevételek és kiadások 1,435 beszkennelt főkönyve fölött, 1793-tól 2024-ig.
Egymás mellé állítva a v2 minden, egy ügynök számára lényeges tengelyen nehezebb:
| v1 | v2 | Változás | |
|---|---|---|---|
| Dokumentumok a korpuszban | 697 | 1,435 | 2× |
| Hivatkozott dokumentumok kérdésenként (átlag) | 1.8 | 6.7 | 3.7× |
| Elolvasandó szöveg kérdésenként (átlag) | ≈1 MB | ≈9 MB | ≈9× |
Kevés benchmark kap második kiadást ugyanabból a feladatból. Az OfficeQA kapott, így a nehézség olyan tengellyé válik, amely mentén mérni lehet.
Hogyan teszteltünk
- Miért az OfficeQA. Hasonlít arra a munkára, amelyet a felhasználóink az Energentre bíznak: megtalálni a megfelelő dokumentumokat, számokat kinyerni sűrű táblázatokból, ezeket összekapcsolni, és ellenőrizhető, pontos választ adni.
- Ugyanaz az ügynök, csak a modell cserélődött. Az Energent-ügynök modellfüggetlen. Ugyanazok az eszközök, promptok és lépéskeret futtatták az Anthropic, az OpenAI és a Google hét élvonalbeli modelljét mindkét kiadáson. A visszaesést a nehezebb adat okozza; rögzített ügynök mellett a modellek közötti különbség abban, hogy mennyit estek, a modellen múlik, nem az ügynökön.
- Ugyanazok a szabályok minden modellre. Minden választ a benchmark hivatalos pontozója értékel, modellenként egy futással.
Eredmények
Pontosság, v1-ről v2-re
Válaszpontosság a hivatalos pontozó szerint, a v2-pontszám alapján rendezve.
| Modell | v1 (133 kérdés) | v2 (90 kérdés) | Változás |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- A v1-en a hét modellből öt egy 7 pontos sávban helyezkedett el; a v2-n ugyanez a hét modell 31 pontot fog át.
- A két helytálló modell, a Fable 5.1 és a GPT-5.6 Sol, a v1-en a középmezőnyben volt, a v2-n pedig az első és a második helyen végzett.
v1: költség- és inferenciaprofil
| Modell | Költség / kérdés | Átl. időtartam | Modellhívás / kérdés | Eszközhívás / kérdés | Eszköz hívásonként |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 perc | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 perc | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 perc | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 perc | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 perc | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 perc | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 perc | 12.3 | 14.0 | 1.14 |
v2: költség- és inferenciaprofil
| Modell | Költség / kérdés | Átl. időtartam | Modellhívás / kérdés | Eszközhívás / kérdés | Eszköz hívásonként |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 perc | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 perc | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 perc | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 perc | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 perc | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 perc | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 perc | 25.9 | 33.0 | 1.27 |
- Minden modell keményebben dolgozott a v2-n: a kérdésenkénti költség 2–3.4-szeresére, a modell- és eszközhívások száma 1.5–2.6-szorosára, az időtartam pedig 1.9–4.1-szeresére nőtt.
- A két helytálló modell másképp érte ezt el: a Fable 5.1 az összes modell közül a legkevesebb eszközhívással és kérdésenként 3.2 perccel, a GPT-5.6 Sol a legtöbb eszközhívással és 6.9 perccel.
Következtetés
Az OfficeQA két kiadása valami ritkát kínál: ugyanazt a feladatot két nehézségi szinten, így látható, mely modellek teljesítenek továbbra is a feladat nehezedésével, és melyek esnek vissza. A v1-en a hét modell szorosan együtt volt; a v2-n messze szétszóródtak. A könnyű adat elrejti a modellek közötti különbségeket, a nehéz adat felszínre hozza őket.
Az Energent felhasználói számára ezt a választást mi hozzuk meg újra és újra: ahogy a feladataik nehezednek, az ő munkatípusukon mérjük a modelleket, kiválasztjuk azt, amelyik tartja magát, és egyensúlyt teremtünk a pontosság, a sebesség és a költség között, anélkül hogy nekik bármit be kellene állítaniuk.
Köszönet
Külön köszönet a Databricks csapatának az OfficeQA-ért: egy nyers, kiváló minőségű és szándékosan nehezebb adatkészletért, amely valódi dokumentumokra épül, gondosan ellenőrzött kérdésekkel, és amely ugyanabból a feladatból két kiadásban jelent meg. Ez a folytonosság tette egyáltalán lehetővé, hogy ezt a trendet lássuk. Az eredményekről részletes tanulmány készül.
Hivatkozások
- Databricks, Az OfficeQA bemutatása, az első kiadás bejelentése
- Databricks, Az OfficeQA Pro V2 bemutatása, a második kiadás bejelentése
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Az OfficeQA repository a GitHubon
- Az OfficeQA Pro V2 adatkészlet a Hugging Face-en
