Databricks hizo OfficeQA más difícil con una segunda edición. Mantuvimos fijo el agente de Energent y comparamos los mismos modelos en ambas ediciones. Las flechas del gráfico superior muestran lo que perdió cada modelo entre ediciones.
TL;DR
- Dos modelos se mantuvieron: Fable 5.1 (72.2% → 70.0%) y GPT-5.6 Sol (71.4% → 68.9%). Cinco cayeron entre 6.5 y 28.8 puntos.
- La clasificación se reordenó. Opus 5 lideraba v1 con un 74.4% y cayó al tercer puesto; Sonnet 5 pasó del 67.7% al 38.9%, del quinto al último puesto.
- «Más difícil» es medible: 2× el corpus (697 → 1,435 documentos), 3.7× los documentos citados por pregunta (1.8 → 6.7) y cerca de 9× el texto que leer por pregunta (≈1 MB → ≈9 MB).
- Para los usuarios de Energent, nada que configurar: el agente es agnóstico al modelo, así que, a medida que tus tareas crecen, medimos, elegimos el modelo que se mantiene y conservamos el mejor rendimiento y velocidad para ti.
Contexto: OfficeQA, de v1 a v2
OfficeQA es el benchmark de Databricks para el razonamiento fundamentado sobre informes financieros del Tesoro de EE. UU. Aquí, v1 es OfficeQA Pro, presentado en el primer anuncio: las 133 preguntas etiquetadas como difíciles en el benchmark original, sobre 697 boletines del Tesoro, redactadas a mano por anotadores humanos.
v2 es OfficeQA Pro V2, presentado en el segundo anuncio: 90 preguntas sobre 1,435 libros contables escaneados de ingresos y gastos federales de 1793 a 2024.
Puestas una junto a la otra, v2 es más difícil en todos los ejes que importan para un agente:
| v1 | v2 | Cambio | |
|---|---|---|---|
| Documentos en el corpus | 697 | 1,435 | 2× |
| Documentos citados por pregunta (media) | 1.8 | 6.7 | 3.7× |
| Texto que leer por pregunta (media) | ≈1 MB | ≈9 MB | ≈9× |
Pocos benchmarks reciben una segunda edición de la misma tarea. OfficeQA la tuvo, lo que convierte la dificultad en un eje a lo largo del cual se puede medir.
Cómo lo probamos
- Por qué OfficeQA. Se parece al trabajo que nuestros usuarios traen a Energent: encontrar los documentos correctos, extraer cifras de tablas densas, combinarlas y devolver una respuesta exacta que se pueda comprobar.
- El mismo agente, solo cambia el modelo. El agente de Energent es agnóstico al modelo. Las mismas herramientas, prompts y presupuesto de pasos ejecutaron siete modelos frontera de Anthropic, OpenAI y Google en ambas ediciones. Los datos más difíciles son lo que provoca la caída; con el agente fijo, las diferencias entre modelos en cuánto cayeron se deben al modelo, no al agente.
- Las mismas reglas para todos los modelos. Cada respuesta se puntúa con el evaluador oficial del benchmark, una ejecución por modelo.
Resultados
Precisión, de v1 a v2
Precisión de las respuestas según el evaluador oficial, ordenada por la puntuación de v2.
| Modelo | v1 (133 preguntas) | v2 (90 preguntas) | Cambio |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- En v1, cinco de los siete modelos se situaban dentro de una banda de 7 puntos; en v2 los mismos siete abarcan 31 puntos.
- Los dos que se mantuvieron, Fable 5.1 y GPT-5.6 Sol, estaban en la zona media en v1 y terminan primero y segundo en v2.
v1: costo y perfil de inferencia
| Modelo | Costo / pregunta | Duración media | Llamadas al modelo / pregunta | Llamadas a herramientas / pregunta | Herramientas por llamada |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: costo y perfil de inferencia
| Modelo | Costo / pregunta | Duración media | Llamadas al modelo / pregunta | Llamadas a herramientas / pregunta | Herramientas por llamada |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Todos los modelos trabajaron más en v2: entre 2 y 3.4 veces el costo por pregunta, entre 1.5 y 2.6 veces las llamadas al modelo y a herramientas, y entre 1.9 y 4.1 veces más tiempo.
- Los dos que se mantuvieron lo hicieron de forma distinta: Fable 5.1 con la menor cantidad de llamadas a herramientas de todos los modelos y 3.2 minutos por pregunta, GPT-5.6 Sol con la mayor cantidad de llamadas a herramientas y 6.9 minutos.
Conclusión
Las dos ediciones de OfficeQA ofrecen algo poco común: la misma tarea en dos niveles de dificultad, de modo que se puede ver qué modelos siguen rindiendo a medida que la tarea se vuelve más difícil y cuáles caen. En v1 los siete modelos estaban agrupados; en v2 se dispersaron mucho. Los datos fáciles ocultan las diferencias entre modelos; los datos difíciles las exponen.
Para los usuarios de Energent, esa elección nos corresponde seguir tomándola a nosotros: a medida que tus tareas se vuelven más difíciles, medimos los modelos en tu tipo de trabajo, elegimos el que se mantiene y equilibramos precisión frente a velocidad y costo, sin que tengas que configurar nada.
Agradecimientos
Un agradecimiento especial al equipo de Databricks por OfficeQA: un conjunto de datos sin procesar, de alta calidad y deliberadamente más difícil, construido sobre documentos reales con preguntas cuidadosamente verificadas, y publicado en dos ediciones de la misma tarea. Esa continuidad es lo que nos permitió ver esta tendencia. Un artículo detallado sobre estos resultados está en preparación.
Referencias
- Databricks, Presentación de OfficeQA, el anuncio de la primera edición
- Databricks, Presentación de OfficeQA Pro V2, el anuncio de la segunda edición
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Repositorio de OfficeQA en GitHub
- Conjunto de datos OfficeQA Pro V2 en Hugging Face
