Moeilijkere data, dezelfde agent: hoe ver elk model terugviel
Databricks heeft OfficeQA moeilijker gemaakt, van OfficeQA Pro naar OfficeQA Pro V2: 2× het corpus, 3.7× het aantal geciteerde documenten per vraag, ongeveer 9× de te lezen tekst. Energent hield zijn modelonafhankelijke agent ongewijzigd en vergeleek zeven frontier-modellen op beide edities. Fable 5.1 en GPT-5.6 Sol bleven binnen 3 punten; de andere vijf vielen 6.5 tot 28.8 punten terug en de rangorde veranderde.
Lees artikel
