Databricks ztížil OfficeQA druhou edicí. Agenta Energent jsme ponechali beze změny a stejné modely jsme porovnali na obou edicích. Šipky v grafu výše ukazují, co každý model mezi edicemi ztratil.
Shrnutí
- Dva modely obstály: Fable 5.1 (72.2% → 70.0%) a GPT-5.6 Sol (71.4% → 68.9%). Pět kleslo o 6.5 až 28.8 bodu.
- Pořadí se přeskupilo. Opus 5 vedl v1 se 74.4% a klesl na třetí místo; Sonnet 5 spadl z 67.7% na 38.9%, z pátého místa na poslední.
- „Těžší“ je měřitelné: 2× větší korpus (697 → 1,435 dokumentů), 3.7× více dokumentů citovaných na otázku (1.8 → 6.7) a zhruba 9× více textu k přečtení na otázku (≈1 MB → ≈9 MB).
- Uživatelé Energentu nemusí nic nastavovat: agent je nezávislý na modelu, takže jak vaše úlohy rostou, my měříme, vybíráme model, který obstojí, a udržujeme pro vás nejlepší výkon i rychlost.
Kontext: OfficeQA, od v1 k v2
OfficeQA je benchmark společnosti Databricks pro podložené uvažování nad finančními výkazy amerického ministerstva financí. v1 zde označuje OfficeQA Pro, představený v prvním oznámení: 133 otázek, které byly v původním benchmarku označeny jako těžké, položených nad 697 bulletiny amerického ministerstva financí (Treasury Bulletins) a ručně napsaných lidskými anotátory.
v2 je OfficeQA Pro V2, představený ve druhém oznámení: 90 otázek nad 1,435 naskenovanými účetními knihami federálních příjmů a výdajů z let 1793 až 2024.
Při srovnání vedle sebe je v2 těžší na každé ose, která je pro agenta důležitá:
| v1 | v2 | Změna | |
|---|---|---|---|
| Dokumentů v korpusu | 697 | 1,435 | 2× |
| Dokumentů citovaných na otázku (průměr) | 1.8 | 6.7 | 3.7× |
| Textu k přečtení na otázku (průměr) | ≈1 MB | ≈9 MB | ≈9× |
Jen málo benchmarků se dočká druhé edice téže úlohy. OfficeQA se jí dočkal, a obtížnost se tak stává osou, podél které lze měřit.
Jak jsme testovali
- Proč OfficeQA. Podobá se práci, kterou naši uživatelé do Energentu přinášejí: najít správné dokumenty, vytáhnout čísla z hustých tabulek, zkombinovat je a vrátit přesnou odpověď, kterou lze ověřit.
- Stejný agent, vyměněn pouze model. Agent Energent je nezávislý na modelu. Stejné nástroje, prompty a rozpočet kroků spouštěly sedm špičkových modelů od Anthropic, OpenAI a Google na obou edicích. Pokles způsobují těžší data; při neměnném agentovi jdou rozdíly mezi modely v tom, o kolik klesly, na vrub modelu, nikoli agenta.
- Stejná pravidla pro každý model. Každou odpověď hodnotí oficiální hodnoticí nástroj benchmarku, jeden běh na model.
Výsledky
Přesnost, od v1 k v2
Přesnost odpovědí podle oficiálního hodnoticího nástroje, seřazeno podle skóre na v2.
| Model | v1 (133 ot.) | v2 (90 ot.) | Změna |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Na v1 leželo pět ze sedmi modelů v pásmu 7 bodů; na v2 se týchž sedm rozprostírá přes 31 bodů.
- Dva modely, které obstály, Fable 5.1 a GPT-5.6 Sol, byly na v1 uprostřed pole a na v2 končí první a druhý.
v1: náklady a profil inference
| Model | Náklady / otázka | Prům. doba | Volání modelu / ot. | Volání nástrojů / ot. | Nástrojů na volání |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: náklady a profil inference
| Model | Náklady / otázka | Prům. doba | Volání modelu / ot. | Volání nástrojů / ot. | Nástrojů na volání |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Každý model na v2 pracoval usilovněji: 2krát až 3.4krát vyšší náklady na otázku, 1.5krát až 2.6krát více volání modelu a nástrojů a 1.9krát až 4.1krát delší doba.
- Dva modely, které obstály, toho dosáhly různě: Fable 5.1 s nejmenším počtem volání nástrojů ze všech modelů a 3.2 minuty na otázku, GPT-5.6 Sol s největším počtem volání nástrojů a 6.9 minuty.
Závěr
Dvě edice OfficeQA nabízejí něco vzácného: stejnou úlohu ve dvou úrovních obtížnosti, takže je vidět, které modely si drží výkon i s rostoucí obtížností úlohy a které klesají. Na v1 bylo sedm modelů natěsnáno k sobě; na v2 se od sebe daleko rozestoupily. Snadná data rozdíly mezi modely skrývají, těžká data je odhalují.
Za uživatele Energentu tuto volbu děláme i nadále my: jak se vaše úlohy stávají těžšími, měříme modely na vašem typu práce, vybíráme ten, který obstojí, a vyvažujeme přesnost s rychlostí a náklady, aniž byste museli cokoli nastavovat.
Poděkování
Zvláštní poděkování patří týmu Databricks za OfficeQA: syrový, vysoce kvalitní a záměrně těžší dataset, postavený na skutečných dokumentech s pečlivě ověřenými otázkami a vydaný ve dvou edicích téže úlohy. Právě tato kontinuita nám vůbec umožnila tento trend vidět. Podrobný článek o těchto výsledcích se připravuje.
Reference
- Databricks, Představujeme OfficeQA, oznámení první edice
- Databricks, Představujeme OfficeQA Pro V2, oznámení druhé edice
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Repozitář OfficeQA na GitHubu
- Dataset OfficeQA Pro V2 na Hugging Face
