Nejdůležitější novinky
OznámeníBenchmark

Těžší data, stejný agent: o kolik každý model klesl

Těžší data Databricks OfficeQA, stejný agent Energent, sedm špičkových modelů: Fable 5.1 a GPT-5.6 Sol obstály s poklesem do 3 bodů, ostatních pět kleslo o 6 až 29.

Tým Energent
Graf se šipkami poklesu sedmi modelů z OfficeQA v1 na v2: Fable 5.1 a GPT-5.6 Sol obstály, pět dalších kleslo
Otevřít graf v plném rozlišení

Databricks ztížil OfficeQA druhou edicí. Agenta Energent jsme ponechali beze změny a stejné modely jsme porovnali na obou edicích. Šipky v grafu výše ukazují, co každý model mezi edicemi ztratil.

Shrnutí

  • Dva modely obstály: Fable 5.1 (72.2% → 70.0%) a GPT-5.6 Sol (71.4% → 68.9%). Pět kleslo o 6.5 až 28.8 bodu.
  • Pořadí se přeskupilo. Opus 5 vedl v1 se 74.4% a klesl na třetí místo; Sonnet 5 spadl z 67.7% na 38.9%, z pátého místa na poslední.
  • „Těžší“ je měřitelné: 2× větší korpus (697 → 1,435 dokumentů), 3.7× více dokumentů citovaných na otázku (1.8 → 6.7) a zhruba 9× více textu k přečtení na otázku (≈1 MB → ≈9 MB).
  • Uživatelé Energentu nemusí nic nastavovat: agent je nezávislý na modelu, takže jak vaše úlohy rostou, my měříme, vybíráme model, který obstojí, a udržujeme pro vás nejlepší výkon i rychlost.

Kontext: OfficeQA, od v1 k v2

OfficeQA je benchmark společnosti Databricks pro podložené uvažování nad finančními výkazy amerického ministerstva financí. v1 zde označuje OfficeQA Pro, představený v prvním oznámení: 133 otázek, které byly v původním benchmarku označeny jako těžké, položených nad 697 bulletiny amerického ministerstva financí (Treasury Bulletins) a ručně napsaných lidskými anotátory.

v2 je OfficeQA Pro V2, představený ve druhém oznámení: 90 otázek nad 1,435 naskenovanými účetními knihami federálních příjmů a výdajů z let 1793 až 2024.

Při srovnání vedle sebe je v2 těžší na každé ose, která je pro agenta důležitá:

v1v2Změna
Dokumentů v korpusu6971,435
Dokumentů citovaných na otázku (průměr)1.86.73.7×
Textu k přečtení na otázku (průměr)≈1 MB≈9 MB≈9×

Jen málo benchmarků se dočká druhé edice téže úlohy. OfficeQA se jí dočkal, a obtížnost se tak stává osou, podél které lze měřit.

Jak jsme testovali

  • Proč OfficeQA. Podobá se práci, kterou naši uživatelé do Energentu přinášejí: najít správné dokumenty, vytáhnout čísla z hustých tabulek, zkombinovat je a vrátit přesnou odpověď, kterou lze ověřit.
  • Stejný agent, vyměněn pouze model. Agent Energent je nezávislý na modelu. Stejné nástroje, prompty a rozpočet kroků spouštěly sedm špičkových modelů od Anthropic, OpenAI a Google na obou edicích. Pokles způsobují těžší data; při neměnném agentovi jdou rozdíly mezi modely v tom, o kolik klesly, na vrub modelu, nikoli agenta.
  • Stejná pravidla pro každý model. Každou odpověď hodnotí oficiální hodnoticí nástroj benchmarku, jeden běh na model.

Výsledky

Přesnost, od v1 k v2

Přesnost odpovědí podle oficiálního hodnoticího nástroje, seřazeno podle skóre na v2.

Modelv1 (133 ot.)v2 (90 ot.)Změna
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • Na v1 leželo pět ze sedmi modelů v pásmu 7 bodů; na v2 se týchž sedm rozprostírá přes 31 bodů.
  • Dva modely, které obstály, Fable 5.1 a GPT-5.6 Sol, byly na v1 uprostřed pole a na v2 končí první a druhý.

v1: náklady a profil inference

ModelNáklady / otázkaPrům. dobaVolání modelu / ot.Volání nástrojů / ot.Nástrojů na volání
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: náklady a profil inference

ModelNáklady / otázkaPrům. dobaVolání modelu / ot.Volání nástrojů / ot.Nástrojů na volání
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Každý model na v2 pracoval usilovněji: 2krát až 3.4krát vyšší náklady na otázku, 1.5krát až 2.6krát více volání modelu a nástrojů a 1.9krát až 4.1krát delší doba.
  • Dva modely, které obstály, toho dosáhly různě: Fable 5.1 s nejmenším počtem volání nástrojů ze všech modelů a 3.2 minuty na otázku, GPT-5.6 Sol s největším počtem volání nástrojů a 6.9 minuty.

Závěr

Dvě edice OfficeQA nabízejí něco vzácného: stejnou úlohu ve dvou úrovních obtížnosti, takže je vidět, které modely si drží výkon i s rostoucí obtížností úlohy a které klesají. Na v1 bylo sedm modelů natěsnáno k sobě; na v2 se od sebe daleko rozestoupily. Snadná data rozdíly mezi modely skrývají, těžká data je odhalují.

Za uživatele Energentu tuto volbu děláme i nadále my: jak se vaše úlohy stávají těžšími, měříme modely na vašem typu práce, vybíráme ten, který obstojí, a vyvažujeme přesnost s rychlostí a náklady, aniž byste museli cokoli nastavovat.

Poděkování

Zvláštní poděkování patří týmu Databricks za OfficeQA: syrový, vysoce kvalitní a záměrně těžší dataset, postavený na skutečných dokumentech s pečlivě ověřenými otázkami a vydaný ve dvou edicích téže úlohy. Právě tato kontinuita nám vůbec umožnila tento trend vidět. Podrobný článek o těchto výsledcích se připravuje.

Reference

  1. Databricks, Představujeme OfficeQA, oznámení první edice
  2. Databricks, Představujeme OfficeQA Pro V2, oznámení druhé edice
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Repozitář OfficeQA na GitHubu
  5. Dataset OfficeQA Pro V2 na Hugging Face

Řešení

Hardware

AI asistované revize CAD a inženýrské návrhové workflow.