Données plus difficiles, même agent : de combien chaque modèle a chuté
Databricks a rendu OfficeQA plus difficile, d’OfficeQA Pro à OfficeQA Pro V2 : 2× le corpus, 3.7× les documents cités par question, environ 9× le texte à lire. Energent a gardé son agent indépendant du modèle inchangé et a comparé sept modèles de pointe sur les deux éditions. Fable 5.1 et GPT-5.6 Sol ont tenu à moins de 3 points ; les cinq autres ont chuté de 6.5 à 28.8, et le classement a changé.
Lire l’article
