Dados mais difíceis, mesmo agente: quanto caiu cada modelo
A Databricks tornou o OfficeQA mais difícil, do OfficeQA Pro ao OfficeQA Pro V2: 2× o corpus, 3.7× os documentos citados por pergunta, cerca de 9× o texto a ler. A Energent manteve fixo o seu agente agnóstico ao modelo e comparou sete modelos de fronteira em ambas as edições. O Fable 5.1 e o GPT-5.6 Sol mantiveram-se dentro de uma margem de 3 pontos; os outros cinco caíram entre 6.5 e 28.8, e a classificação mudou.
Ler artigo
