Date mai grele, același agent: cât a scăzut fiecare model
Databricks a făcut OfficeQA mai greu, de la OfficeQA Pro la OfficeQA Pro V2: de 2× corpusul, de 3.7× documentele citate per întrebare, de aproximativ 9× textul de citit. Energent și-a păstrat agentul independent de model neschimbat și a comparat șapte modele de frontieră pe ambele ediții. Fable 5.1 și GPT-5.6 Sol s-au menținut în limita a 3 puncte; celelalte cinci au scăzut cu 6.5 până la 28.8, iar clasamentul s-a schimbat.
Citește articolul
