Databricks a făcut OfficeQA mai greu printr-o a doua ediție. Am păstrat agentul Energent neschimbat și am comparat aceleași modele pe ambele ediții. Săgețile din graficul de mai sus arată ce a pierdut fiecare model între ediții.
Pe scurt
- Două modele s-au menținut: Fable 5.1 (72.2% → 70.0%) și GPT-5.6 Sol (71.4% → 68.9%). Cinci au scăzut cu 6.5 până la 28.8 puncte.
- Clasamentul s-a reamestecat. Opus 5 a condus v1 cu 74.4% și a coborât pe locul trei; Sonnet 5 a trecut de la 67.7% la 38.9%, de pe locul cinci pe ultimul.
- „Mai greu” este măsurabil: de 2× corpusul (697 → 1,435 de documente), de 3.7× documentele citate per întrebare (1.8 → 6.7) și de aproximativ 9× textul de citit per întrebare (≈1 MB → ≈9 MB).
- Pentru utilizatorii Energent, nimic de configurat: agentul este independent de model, așa că, pe măsură ce sarcinile dumneavoastră cresc, noi măsurăm, alegem modelul care se menține și păstrăm pentru dumneavoastră cea mai bună performanță și viteză.
Context: OfficeQA, de la v1 la v2
OfficeQA este benchmarkul Databricks pentru raționament fundamentat pe rapoartele financiare ale Trezoreriei SUA. v1 este aici OfficeQA Pro, introdus în primul anunț: cele 133 de întrebări etichetate ca grele în benchmarkul original, pe 697 de Buletine ale Trezoreriei, scrise manual de adnotatori umani.
v2 este OfficeQA Pro V2, introdus în al doilea anunț: 90 de întrebări pe 1,435 de registre scanate ale încasărilor și cheltuielilor federale din 1793 până în 2024.
Puse față în față, v2 este mai greu pe fiecare axă care contează pentru un agent:
| v1 | v2 | Schimbare | |
|---|---|---|---|
| Documente în corpus | 697 | 1,435 | 2× |
| Documente citate per întrebare (medie) | 1.8 | 6.7 | 3.7× |
| Text de citit per întrebare (medie) | ≈1 MB | ≈9 MB | ≈9× |
Puține benchmarkuri primesc o a doua ediție a aceleiași sarcini. OfficeQA a primit-o, ceea ce face din dificultate o axă de-a lungul căreia se poate măsura.
Cum am testat
- De ce OfficeQA. Seamănă cu munca pe care utilizatorii noștri o aduc în Energent: găsirea documentelor potrivite, extragerea cifrelor din tabele dense, combinarea lor și returnarea unui răspuns exact care poate fi verificat.
- Același agent, doar modelul schimbat. Agentul Energent este independent de model. Aceleași instrumente, aceleași prompturi și același buget de pași au rulat șapte modele de frontieră de la Anthropic, OpenAI și Google pe ambele ediții. Datele mai grele sunt cele care determină scăderea; cu agentul fixat, diferențele dintre modele în privința cât de mult au scăzut țin de model, nu de agent.
- Aceleași reguli pentru fiecare model. Fiecare răspuns este punctat de evaluatorul oficial al benchmarkului, o singură rulare per model.
Rezultate
Acuratețe, de la v1 la v2
Acuratețea răspunsurilor conform evaluatorului oficial, sortată după scorul v2.
| Model | v1 (133 întrebări) | v2 (90 întrebări) | Schimbare |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Pe v1, cinci dintre cele șapte modele se aflau într-o bandă de 7 puncte; pe v2, aceleași șapte se întind pe 31 de puncte.
- Cele două care s-au menținut, Fable 5.1 și GPT-5.6 Sol, erau la mijlocul plutonului pe v1 și termină pe primul și al doilea loc pe v2.
v1: profil de cost și inferență
| Model | Cost / întrebare | Durată medie | Apeluri de model / întrebare | Apeluri de instrumente / întrebare | Instrumente per apel |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: profil de cost și inferență
| Model | Cost / întrebare | Durată medie | Apeluri de model / întrebare | Apeluri de instrumente / întrebare | Instrumente per apel |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Fiecare model a muncit mai mult pe v2: de 2 până la 3.4 ori costul per întrebare, de 1.5 până la 2.6 ori apelurile de model și de instrumente și de 1.9 până la 4.1 ori mai mult timp.
- Cele două care s-au menținut au făcut-o diferit: Fable 5.1 cu cele mai puține apeluri de instrumente dintre toate modelele și 3.2 minute per întrebare, GPT-5.6 Sol cu cele mai multe apeluri de instrumente și 6.9 minute.
Concluzie
Cele două ediții ale OfficeQA oferă ceva rar: aceeași sarcină la două niveluri de dificultate, astfel încât se poate vedea care modele continuă să performeze pe măsură ce sarcina devine mai grea și care scad. Pe v1 cele șapte modele erau grupate strâns; pe v2 s-au răspândit mult. Datele ușoare ascund diferențele dintre modele, datele grele le scot la iveală.
Pentru utilizatorii Energent, această alegere rămâne în sarcina noastră: pe măsură ce sarcinile dumneavoastră devin mai grele, măsurăm modelele pe tipul dumneavoastră de muncă, îl alegem pe cel care se menține și echilibrăm acuratețea cu viteza și costul, fără să aveți nimic de configurat.
Mulțumiri
Mulțumiri speciale echipei Databricks pentru OfficeQA: un set de date brut, de înaltă calitate și deliberat mai greu, construit pe documente reale, cu întrebări verificate cu atenție, și lansat în două ediții ale aceleiași sarcini. Această continuitate este ceea ce ne-a permis să vedem această tendință. O lucrare detaliată despre aceste rezultate este în pregătire.
Referințe
- Databricks, Vă prezentăm OfficeQA, anunțul primei ediții
- Databricks, Vă prezentăm OfficeQA Pro V2, anunțul celei de-a doua ediții
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Depozitul OfficeQA pe GitHub
- Setul de date OfficeQA Pro V2 pe Hugging Face
