Schwierigere Daten, gleicher Agent: Wie stark jedes Modell abfiel
Databricks hat OfficeQA schwieriger gemacht, von OfficeQA Pro zu OfficeQA Pro V2: 2× so großer Korpus, 3.7× so viele zitierte Dokumente pro Frage, etwa 9× so viel zu lesender Text. Energent ließ seinen modellagnostischen Agenten unverändert und verglich sieben Frontier-Modelle auf beiden Ausgaben. Fable 5.1 und GPT-5.6 Sol blieben innerhalb von 3 Punkten; die anderen fünf fielen um 6.5 bis 28.8, und die Rangfolge änderte sich.
Artikel lesen
