Databricks ha reso OfficeQA più difficile con una seconda edizione. Abbiamo mantenuto fisso l’agente Energent e confrontato gli stessi modelli su entrambe le edizioni. Le frecce nel grafico qui sopra mostrano quanto ha perso ogni modello tra le due edizioni.
In breve
- Due modelli hanno tenuto: Fable 5.1 (72.2% → 70.0%) e GPT-5.6 Sol (71.4% → 68.9%). Cinque sono calati da 6.5 a 28.8 punti.
- La classifica si è rimescolata. Opus 5 guidava la v1 con il 74.4% ed è sceso al terzo posto; Sonnet 5 è passato dal 67.7% al 38.9%, dal quinto all’ultimo posto.
- «Più difficile» è misurabile: 2× il corpus (697 → 1,435 documenti), 3.7× i documenti citati per domanda (1.8 → 6.7) e circa 9× il testo da leggere per domanda (≈1 MB → ≈9 MB).
- Per gli utenti di Energent non c’è nulla da configurare: l’agente è indipendente dal modello, quindi man mano che i vostri compiti crescono noi misuriamo, scegliamo il modello che tiene e manteniamo per voi le migliori prestazioni e la migliore velocità.
Contesto: OfficeQA, da v1 a v2
OfficeQA è il benchmark di Databricks per il ragionamento fondato sulle fonti (grounded reasoning) applicato ai report finanziari del Tesoro degli Stati Uniti. Qui la v1 è OfficeQA Pro, introdotta nel primo annuncio: le 133 domande etichettate come difficili nel benchmark originale, su 697 Treasury Bulletin, scritte a mano da annotatori umani.
La v2 è OfficeQA Pro V2, introdotta nel secondo annuncio: 90 domande su 1,435 registri contabili scansionati di entrate e spese federali dal 1793 al 2024.
Messe a confronto, la v2 è più difficile su ogni asse che conta per un agente:
| v1 | v2 | Variazione | |
|---|---|---|---|
| Documenti nel corpus | 697 | 1,435 | 2× |
| Documenti citati per domanda (media) | 1.8 | 6.7 | 3.7× |
| Testo da leggere per domanda (media) | ≈1 MB | ≈9 MB | ≈9× |
Pochi benchmark ricevono una seconda edizione dello stesso compito. OfficeQA l’ha avuta, e questo rende la difficoltà un asse lungo il quale si può misurare.
Come abbiamo testato
- Perché OfficeQA. Assomiglia al lavoro che i nostri utenti portano su Energent: trovare i documenti giusti, estrarre cifre da tabelle dense, combinarle e restituire una risposta esatta che possa essere verificata.
- Stesso agente, cambia solo il modello. L’agente Energent è indipendente dal modello. Gli stessi strumenti, prompt e budget di passi hanno eseguito sette modelli di frontiera di Anthropic, OpenAI e Google su entrambe le edizioni. Sono i dati più difficili a causare il calo; con l’agente fisso, le differenze tra i modelli nella misura del calo dipendono dal modello, non dall’agente.
- Stesse regole per ogni modello. Ogni risposta è valutata dal sistema di valutazione ufficiale del benchmark, un’esecuzione per modello.
Risultati
Accuratezza, da v1 a v2
Accuratezza delle risposte secondo il sistema di valutazione ufficiale, ordinata per punteggio v2.
| Modello | v1 (133 domande) | v2 (90 domande) | Variazione |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Sulla v1, cinque dei sette modelli erano racchiusi in una fascia di 7 punti; sulla v2 gli stessi sette coprono un intervallo di 31 punti.
- I due che hanno tenuto, Fable 5.1 e GPT-5.6 Sol, erano a metà classifica sulla v1 e finiscono primo e secondo sulla v2.
v1: costo e profilo di inferenza
| Modello | Costo / domanda | Durata media | Chiamate modello / domanda | Chiamate strumenti / domanda | Strumenti per chiamata |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: costo e profilo di inferenza
| Modello | Costo / domanda | Durata media | Chiamate modello / domanda | Chiamate strumenti / domanda | Strumenti per chiamata |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Ogni modello ha lavorato di più sulla v2: da 2 a 3.4 volte il costo per domanda, da 1.5 a 2.6 volte le chiamate al modello e agli strumenti, e da 1.9 a 4.1 volte il tempo.
- I due che hanno tenuto lo hanno fatto in modo diverso: Fable 5.1 con il minor numero di chiamate agli strumenti tra tutti i modelli e 3.2 minuti per domanda, GPT-5.6 Sol con il maggior numero di chiamate agli strumenti e 6.9 minuti.
Conclusione
Le due edizioni di OfficeQA offrono qualcosa di raro: lo stesso compito a due livelli di difficoltà, così da vedere quali modelli continuano a funzionare man mano che il compito si fa più difficile e quali calano. Sulla v1 i sette modelli erano raggruppati; sulla v2 si sono distanziati molto. I dati facili nascondono le differenze tra i modelli, i dati difficili le rivelano.
Per gli utenti di Energent, quella scelta continua a spettare a noi: man mano che i vostri compiti diventano più difficili, misuriamo i modelli sul vostro tipo di lavoro, scegliamo quello che tiene e bilanciamo l’accuratezza con velocità e costo, senza che dobbiate configurare nulla.
Ringraziamenti
Un ringraziamento speciale al team di Databricks per OfficeQA: un dataset grezzo, di alta qualità e deliberatamente più difficile, costruito su documenti reali con domande verificate con cura, e pubblicato in due edizioni dello stesso compito. È proprio quella continuità che ci ha permesso di vedere questa tendenza. Un paper dettagliato su questi risultati è in preparazione.
Riferimenti
- Databricks, Presentazione di OfficeQA, l’annuncio della prima edizione
- Databricks, Presentazione di OfficeQA Pro V2, l’annuncio della seconda edizione
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Repository di OfficeQA su GitHub
- Dataset OfficeQA Pro V2 su Hugging Face
