Vanskeligere data, samme agent: hvor mye hver modell falt
Databricks gjorde OfficeQA vanskeligere, fra OfficeQA Pro til OfficeQA Pro V2: 2× så stort korpus, 3.7× så mange siterte dokumenter per spørsmål, omtrent 9× så mye tekst å lese. Energent holdt sin modellagnostiske agent uendret og sammenlignet sju ledende modeller på begge utgavene. Fable 5.1 og GPT-5.6 Sol holdt seg innenfor 3 poeng; de fem andre falt med 6.5 til 28.8, og rangeringen endret seg.
Les artikkel
