Sværere data, samme agent: så meget faldt hver model
Databricks gjorde OfficeQA sværere, fra OfficeQA Pro til OfficeQA Pro V2: 2× så stort et korpus, 3.7× så mange citerede dokumenter pr. spørgsmål, omkring 9× så meget tekst at læse. Energent holdt sin modelagnostiske agent uændret og sammenlignede syv frontier-modeller på begge udgaver. Fable 5.1 og GPT-5.6 Sol holdt sig inden for 3 point; de fem andre faldt med 6.5 til 28.8, og rangordenen ændrede sig.
Læs artikel
