Aspectos destacados
AnunciosBenchmark

Datos más difíciles, mismo agente: cuánto cayó cada modelo

Datos más difíciles de Databricks OfficeQA, el mismo agente de Energent, siete modelos frontera: Fable 5.1 y GPT-5.6 Sol se mantuvieron a menos de 3 puntos; los otros cinco cayeron entre 6 y 29.

Equipo de Energent
Gráfico de flechas de caída de siete modelos de OfficeQA v1 a v2: Fable 5.1 y GPT-5.6 Sol se mantuvieron, otros cinco cayeron
Abrir el gráfico en resolución completa

Databricks hizo OfficeQA más difícil con una segunda edición. Mantuvimos fijo el agente de Energent y comparamos los mismos modelos en ambas ediciones. Las flechas del gráfico superior muestran lo que perdió cada modelo entre ediciones.

TL;DR

  • Dos modelos se mantuvieron: Fable 5.1 (72.2% → 70.0%) y GPT-5.6 Sol (71.4% → 68.9%). Cinco cayeron entre 6.5 y 28.8 puntos.
  • La clasificación se reordenó. Opus 5 lideraba v1 con un 74.4% y cayó al tercer puesto; Sonnet 5 pasó del 67.7% al 38.9%, del quinto al último puesto.
  • «Más difícil» es medible: 2× el corpus (697 → 1,435 documentos), 3.7× los documentos citados por pregunta (1.8 → 6.7) y cerca de 9× el texto que leer por pregunta (≈1 MB → ≈9 MB).
  • Para los usuarios de Energent, nada que configurar: el agente es agnóstico al modelo, así que, a medida que tus tareas crecen, medimos, elegimos el modelo que se mantiene y conservamos el mejor rendimiento y velocidad para ti.

Contexto: OfficeQA, de v1 a v2

OfficeQA es el benchmark de Databricks para el razonamiento fundamentado sobre informes financieros del Tesoro de EE. UU. Aquí, v1 es OfficeQA Pro, presentado en el primer anuncio: las 133 preguntas etiquetadas como difíciles en el benchmark original, sobre 697 boletines del Tesoro, redactadas a mano por anotadores humanos.

v2 es OfficeQA Pro V2, presentado en el segundo anuncio: 90 preguntas sobre 1,435 libros contables escaneados de ingresos y gastos federales de 1793 a 2024.

Puestas una junto a la otra, v2 es más difícil en todos los ejes que importan para un agente:

v1v2Cambio
Documentos en el corpus6971,435
Documentos citados por pregunta (media)1.86.73.7×
Texto que leer por pregunta (media)≈1 MB≈9 MB≈9×

Pocos benchmarks reciben una segunda edición de la misma tarea. OfficeQA la tuvo, lo que convierte la dificultad en un eje a lo largo del cual se puede medir.

Cómo lo probamos

  • Por qué OfficeQA. Se parece al trabajo que nuestros usuarios traen a Energent: encontrar los documentos correctos, extraer cifras de tablas densas, combinarlas y devolver una respuesta exacta que se pueda comprobar.
  • El mismo agente, solo cambia el modelo. El agente de Energent es agnóstico al modelo. Las mismas herramientas, prompts y presupuesto de pasos ejecutaron siete modelos frontera de Anthropic, OpenAI y Google en ambas ediciones. Los datos más difíciles son lo que provoca la caída; con el agente fijo, las diferencias entre modelos en cuánto cayeron se deben al modelo, no al agente.
  • Las mismas reglas para todos los modelos. Cada respuesta se puntúa con el evaluador oficial del benchmark, una ejecución por modelo.

Resultados

Precisión, de v1 a v2

Precisión de las respuestas según el evaluador oficial, ordenada por la puntuación de v2.

Modelov1 (133 preguntas)v2 (90 preguntas)Cambio
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • En v1, cinco de los siete modelos se situaban dentro de una banda de 7 puntos; en v2 los mismos siete abarcan 31 puntos.
  • Los dos que se mantuvieron, Fable 5.1 y GPT-5.6 Sol, estaban en la zona media en v1 y terminan primero y segundo en v2.

v1: costo y perfil de inferencia

ModeloCosto / preguntaDuración mediaLlamadas al modelo / preguntaLlamadas a herramientas / preguntaHerramientas por llamada
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: costo y perfil de inferencia

ModeloCosto / preguntaDuración mediaLlamadas al modelo / preguntaLlamadas a herramientas / preguntaHerramientas por llamada
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Todos los modelos trabajaron más en v2: entre 2 y 3.4 veces el costo por pregunta, entre 1.5 y 2.6 veces las llamadas al modelo y a herramientas, y entre 1.9 y 4.1 veces más tiempo.
  • Los dos que se mantuvieron lo hicieron de forma distinta: Fable 5.1 con la menor cantidad de llamadas a herramientas de todos los modelos y 3.2 minutos por pregunta, GPT-5.6 Sol con la mayor cantidad de llamadas a herramientas y 6.9 minutos.

Conclusión

Las dos ediciones de OfficeQA ofrecen algo poco común: la misma tarea en dos niveles de dificultad, de modo que se puede ver qué modelos siguen rindiendo a medida que la tarea se vuelve más difícil y cuáles caen. En v1 los siete modelos estaban agrupados; en v2 se dispersaron mucho. Los datos fáciles ocultan las diferencias entre modelos; los datos difíciles las exponen.

Para los usuarios de Energent, esa elección nos corresponde seguir tomándola a nosotros: a medida que tus tareas se vuelven más difíciles, medimos los modelos en tu tipo de trabajo, elegimos el que se mantiene y equilibramos precisión frente a velocidad y costo, sin que tengas que configurar nada.

Agradecimientos

Un agradecimiento especial al equipo de Databricks por OfficeQA: un conjunto de datos sin procesar, de alta calidad y deliberadamente más difícil, construido sobre documentos reales con preguntas cuidadosamente verificadas, y publicado en dos ediciones de la misma tarea. Esa continuidad es lo que nos permitió ver esta tendencia. Un artículo detallado sobre estos resultados está en preparación.

Referencias

  1. Databricks, Presentación de OfficeQA, el anuncio de la primera edición
  2. Databricks, Presentación de OfficeQA Pro V2, el anuncio de la segunda edición
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Repositorio de OfficeQA en GitHub
  5. Conjunto de datos OfficeQA Pro V2 en Hugging Face

Soluciones

Hardware

Revisiones de CAD asistidas por IA y flujos de trabajo de diseño de ingeniería.