Databricks a rendu OfficeQA plus difficile avec une deuxième édition. Nous avons gardé l’agent Energent inchangé et comparé les mêmes modèles sur les deux éditions. Les flèches du graphique ci-dessus montrent ce que chaque modèle a perdu d’une édition à l’autre.
TL;DR
- Deux modèles ont tenu : Fable 5.1 (72.2% → 70.0%) et GPT-5.6 Sol (71.4% → 68.9%). Cinq ont chuté de 6.5 à 28.8 points.
- Le classement a été rebattu. Opus 5 menait la v1 à 74.4% et est tombé à la troisième place ; Sonnet 5 est passé de 67.7% à 38.9%, de la cinquième à la dernière place.
- « Plus difficile » se mesure : 2× le corpus (697 → 1,435 documents), 3.7× les documents cités par question (1.8 → 6.7) et environ 9× le texte à lire par question (≈1 MB → ≈9 MB).
- Pour les utilisateurs d’Energent, rien à configurer : l’agent est indépendant du modèle, donc à mesure que vos tâches grandissent, nous mesurons, choisissons le modèle qui tient et vous conservons les meilleures performances et la meilleure vitesse.
Contexte : OfficeQA, de v1 à v2
OfficeQA est le benchmark de Databricks pour le raisonnement fondé sur les rapports financiers du Trésor américain. Ici, v1 désigne OfficeQA Pro, présenté dans la première annonce : les 133 questions étiquetées difficiles dans le benchmark d’origine, portant sur 697 Treasury Bulletins, rédigées à la main par des annotateurs humains.
v2 désigne OfficeQA Pro V2, présenté dans la seconde annonce : 90 questions portant sur 1,435 registres numérisés des recettes et dépenses fédérales de 1793 à 2024.
Côte à côte, v2 est plus difficile sur chaque axe qui compte pour un agent :
| v1 | v2 | Variation | |
|---|---|---|---|
| Documents dans le corpus | 697 | 1,435 | 2× |
| Documents cités par question (moyenne) | 1.8 | 6.7 | 3.7× |
| Texte à lire par question (moyenne) | ≈1 MB | ≈9 MB | ≈9× |
Peu de benchmarks connaissent une deuxième édition de la même tâche. OfficeQA en a eu une, ce qui fait de la difficulté un axe sur lequel on peut mesurer.
Comment nous avons testé
- Pourquoi OfficeQA. Il ressemble au travail que nos utilisateurs confient à Energent : trouver les bons documents, extraire des chiffres de tableaux denses, les combiner et renvoyer une réponse exacte qui peut être vérifiée.
- Même agent, seul le modèle change. L’agent Energent est indépendant du modèle. Les mêmes outils, prompts et budget d’étapes ont fait tourner sept modèles de pointe d’Anthropic, OpenAI et Google sur les deux éditions. Ce sont les données plus difficiles qui provoquent la chute ; l’agent étant fixe, les écarts entre modèles dans l’ampleur de leur chute tiennent au modèle, pas à l’agent.
- Mêmes règles pour chaque modèle. Chaque réponse est notée par le système de notation officiel du benchmark, une exécution par modèle.
Résultats
Précision, de v1 à v2
Précision des réponses selon le système de notation officiel, triée par le score v2.
| Modèle | v1 (133 q) | v2 (90 q) | Variation |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Sur v1, cinq des sept modèles se situaient dans une fourchette de 7 points ; sur v2, les mêmes sept s’étalent sur 31 points.
- Les deux qui ont tenu, Fable 5.1 et GPT-5.6 Sol, étaient en milieu de peloton sur v1 et terminent premier et deuxième sur v2.
v1 : coût et profil d’inférence
| Modèle | Coût / question | Durée moyenne | Appels modèle / q | Appels outils / q | Outils par appel |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2 : coût et profil d’inférence
| Modèle | Coût / question | Durée moyenne | Appels modèle / q | Appels outils / q | Outils par appel |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Chaque modèle a travaillé davantage sur v2 : 2 à 3.4 fois le coût par question, 1.5 à 2.6 fois les appels modèle et outils, et 1.9 à 4.1 fois plus de temps.
- Les deux qui ont tenu l’ont fait différemment : Fable 5.1 avec le moins d’appels outils de tous les modèles et 3.2 minutes par question, GPT-5.6 Sol avec le plus d’appels outils et 6.9 minutes.
Conclusion
Les deux éditions d’OfficeQA offrent quelque chose de rare : la même tâche à deux niveaux de difficulté, ce qui permet de voir quels modèles continuent de performer quand la tâche se durcit et lesquels décrochent. Sur v1, les sept modèles étaient regroupés ; sur v2, ils se sont largement dispersés. Les données faciles masquent les différences entre modèles, les données difficiles les révèlent.
Pour les utilisateurs d’Energent, ce choix nous revient et nous continuons de le faire : à mesure que vos tâches se durcissent, nous mesurons les modèles sur votre type de travail, choisissons celui qui tient et arbitrons entre précision, vitesse et coût, sans rien à configurer de votre côté.
Remerciements
Un grand merci à l’équipe Databricks pour OfficeQA : un jeu de données brut, de grande qualité et volontairement plus difficile, construit sur des documents réels avec des questions soigneusement vérifiées, et publié en deux éditions de la même tâche. C’est cette continuité qui nous a permis d’observer cette tendance. Un article détaillé sur ces résultats est en préparation.
Références
- Databricks, Présentation d’OfficeQA, l’annonce de la première édition
- Databricks, Présentation d’OfficeQA Pro V2, l’annonce de la seconde édition
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Dépôt OfficeQA sur GitHub
- Jeu de données OfficeQA Pro V2 sur Hugging Face
