Trudniejsze dane, ten sam agent: o ile spadł każdy model
Databricks utrudnił OfficeQA, przechodząc od OfficeQA Pro do OfficeQA Pro V2: 2× większy korpus, 3.7× więcej dokumentów cytowanych na pytanie, około 9× więcej tekstu do przeczytania. Energent utrzymał swojego niezależnego od modelu agenta bez zmian i porównał siedem czołowych modeli na obu edycjach. Fable 5.1 i GPT-5.6 Sol utrzymały się w granicach 3 punktów; pozostałe pięć spadło o 6.5 do 28.8, a ranking się zmienił.
Przeczytaj artykuł
