Svårare data, samma agent: hur mycket varje modell föll
Databricks gjorde OfficeQA svårare, från OfficeQA Pro till OfficeQA Pro V2: 2× så stor korpus, 3.7× så många citerade dokument per fråga, ungefär 9× så mycket text att läsa. Energent höll sin modellagnostiska agent oförändrad och jämförde sju frontier-modeller på båda utgåvorna. Fable 5.1 och GPT-5.6 Sol höll sig inom 3 poäng; de övriga fem föll med 6.5 till 28.8, och rangordningen ändrades.
Läs artikeln
