Těžší data, stejný agent: o kolik každý model klesl
Databricks ztížil OfficeQA, z OfficeQA Pro na OfficeQA Pro V2: 2× větší korpus, 3.7× více dokumentů citovaných na otázku, zhruba 9× více textu k přečtení. Energent ponechal svého agenta nezávislého na modelu beze změny a porovnal sedm špičkových modelů na obou edicích. Fable 5.1 a GPT-5.6 Sol obstály s poklesem do 3 bodů; ostatních pět kleslo o 6.5 až 28.8 a pořadí se změnilo.
Přečíst článek
