Dati più difficili, stesso agente: quanto è calato ogni modello
Databricks ha reso OfficeQA più difficile, da OfficeQA Pro a OfficeQA Pro V2: 2× il corpus, 3.7× i documenti citati per domanda, circa 9× il testo da leggere. Energent ha mantenuto fisso il suo agente indipendente dal modello e ha confrontato sette modelli di frontiera su entrambe le edizioni. Fable 5.1 e GPT-5.6 Sol hanno tenuto entro 3 punti; gli altri cinque sono calati da 6.5 a 28.8, e la classifica è cambiata.
Leggi l'articolo
