Datos más difíciles, mismo agente: cuánto cayó cada modelo
Databricks hizo OfficeQA más difícil, de OfficeQA Pro a OfficeQA Pro V2: 2× el corpus, 3.7× los documentos citados por pregunta, cerca de 9× el texto que leer. Energent mantuvo fijo su agente agnóstico al modelo y comparó siete modelos frontera en ambas ediciones. Fable 5.1 y GPT-5.6 Sol se mantuvieron a menos de 3 puntos; los otros cinco cayeron entre 6.5 y 28.8, y la clasificación cambió.
Leer artículo
