In evidenza
AnnunciBenchmark

Dati più difficili, stesso agente: quanto è calato ogni modello

Dati OfficeQA di Databricks più difficili, stesso agente Energent, sette modelli di frontiera: Fable 5.1 e GPT-5.6 Sol hanno tenuto entro 3 punti, gli altri cinque sono calati da 6 a 29.

Team Energent
Grafico a frecce di sette modelli da OfficeQA v1 a v2: Fable 5.1 e GPT-5.6 Sol hanno tenuto, altri cinque sono calati
Apri il grafico a piena risoluzione

Databricks ha reso OfficeQA più difficile con una seconda edizione. Abbiamo mantenuto fisso l’agente Energent e confrontato gli stessi modelli su entrambe le edizioni. Le frecce nel grafico qui sopra mostrano quanto ha perso ogni modello tra le due edizioni.

In breve

  • Due modelli hanno tenuto: Fable 5.1 (72.2% → 70.0%) e GPT-5.6 Sol (71.4% → 68.9%). Cinque sono calati da 6.5 a 28.8 punti.
  • La classifica si è rimescolata. Opus 5 guidava la v1 con il 74.4% ed è sceso al terzo posto; Sonnet 5 è passato dal 67.7% al 38.9%, dal quinto all’ultimo posto.
  • «Più difficile» è misurabile: 2× il corpus (697 → 1,435 documenti), 3.7× i documenti citati per domanda (1.8 → 6.7) e circa 9× il testo da leggere per domanda (≈1 MB → ≈9 MB).
  • Per gli utenti di Energent non c’è nulla da configurare: l’agente è indipendente dal modello, quindi man mano che i vostri compiti crescono noi misuriamo, scegliamo il modello che tiene e manteniamo per voi le migliori prestazioni e la migliore velocità.

Contesto: OfficeQA, da v1 a v2

OfficeQA è il benchmark di Databricks per il ragionamento fondato sulle fonti (grounded reasoning) applicato ai report finanziari del Tesoro degli Stati Uniti. Qui la v1 è OfficeQA Pro, introdotta nel primo annuncio: le 133 domande etichettate come difficili nel benchmark originale, su 697 Treasury Bulletin, scritte a mano da annotatori umani.

La v2 è OfficeQA Pro V2, introdotta nel secondo annuncio: 90 domande su 1,435 registri contabili scansionati di entrate e spese federali dal 1793 al 2024.

Messe a confronto, la v2 è più difficile su ogni asse che conta per un agente:

v1v2Variazione
Documenti nel corpus6971,435
Documenti citati per domanda (media)1.86.73.7×
Testo da leggere per domanda (media)≈1 MB≈9 MB≈9×

Pochi benchmark ricevono una seconda edizione dello stesso compito. OfficeQA l’ha avuta, e questo rende la difficoltà un asse lungo il quale si può misurare.

Come abbiamo testato

  • Perché OfficeQA. Assomiglia al lavoro che i nostri utenti portano su Energent: trovare i documenti giusti, estrarre cifre da tabelle dense, combinarle e restituire una risposta esatta che possa essere verificata.
  • Stesso agente, cambia solo il modello. L’agente Energent è indipendente dal modello. Gli stessi strumenti, prompt e budget di passi hanno eseguito sette modelli di frontiera di Anthropic, OpenAI e Google su entrambe le edizioni. Sono i dati più difficili a causare il calo; con l’agente fisso, le differenze tra i modelli nella misura del calo dipendono dal modello, non dall’agente.
  • Stesse regole per ogni modello. Ogni risposta è valutata dal sistema di valutazione ufficiale del benchmark, un’esecuzione per modello.

Risultati

Accuratezza, da v1 a v2

Accuratezza delle risposte secondo il sistema di valutazione ufficiale, ordinata per punteggio v2.

Modellov1 (133 domande)v2 (90 domande)Variazione
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • Sulla v1, cinque dei sette modelli erano racchiusi in una fascia di 7 punti; sulla v2 gli stessi sette coprono un intervallo di 31 punti.
  • I due che hanno tenuto, Fable 5.1 e GPT-5.6 Sol, erano a metà classifica sulla v1 e finiscono primo e secondo sulla v2.

v1: costo e profilo di inferenza

ModelloCosto / domandaDurata mediaChiamate modello / domandaChiamate strumenti / domandaStrumenti per chiamata
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: costo e profilo di inferenza

ModelloCosto / domandaDurata mediaChiamate modello / domandaChiamate strumenti / domandaStrumenti per chiamata
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Ogni modello ha lavorato di più sulla v2: da 2 a 3.4 volte il costo per domanda, da 1.5 a 2.6 volte le chiamate al modello e agli strumenti, e da 1.9 a 4.1 volte il tempo.
  • I due che hanno tenuto lo hanno fatto in modo diverso: Fable 5.1 con il minor numero di chiamate agli strumenti tra tutti i modelli e 3.2 minuti per domanda, GPT-5.6 Sol con il maggior numero di chiamate agli strumenti e 6.9 minuti.

Conclusione

Le due edizioni di OfficeQA offrono qualcosa di raro: lo stesso compito a due livelli di difficoltà, così da vedere quali modelli continuano a funzionare man mano che il compito si fa più difficile e quali calano. Sulla v1 i sette modelli erano raggruppati; sulla v2 si sono distanziati molto. I dati facili nascondono le differenze tra i modelli, i dati difficili le rivelano.

Per gli utenti di Energent, quella scelta continua a spettare a noi: man mano che i vostri compiti diventano più difficili, misuriamo i modelli sul vostro tipo di lavoro, scegliamo quello che tiene e bilanciamo l’accuratezza con velocità e costo, senza che dobbiate configurare nulla.

Ringraziamenti

Un ringraziamento speciale al team di Databricks per OfficeQA: un dataset grezzo, di alta qualità e deliberatamente più difficile, costruito su documenti reali con domande verificate con cura, e pubblicato in due edizioni dello stesso compito. È proprio quella continuità che ci ha permesso di vedere questa tendenza. Un paper dettagliato su questi risultati è in preparazione.

Riferimenti

  1. Databricks, Presentazione di OfficeQA, l’annuncio della prima edizione
  2. Databricks, Presentazione di OfficeQA Pro V2, l’annuncio della seconda edizione
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Repository di OfficeQA su GitHub
  5. Dataset OfficeQA Pro V2 su Hugging Face

Soluzioni

Hardware

Revisioni CAD assistite dall'AI e flussi di lavoro di progettazione ingegneristica.