Databricks hat OfficeQA mit einer zweiten Ausgabe schwieriger gemacht. Wir haben den Energent-Agenten unverändert gelassen und dieselben Modelle auf beiden Ausgaben verglichen. Die Pfeile im Diagramm oben zeigen, was jedes Modell zwischen den Ausgaben verloren hat.
Kurzfassung
- Zwei Modelle hielten stand: Fable 5.1 (72.2% → 70.0%) und GPT-5.6 Sol (71.4% → 68.9%). Fünf fielen um 6.5 bis 28.8 Punkte.
- Die Rangfolge hat sich neu sortiert. Opus 5 führte v1 mit 74.4% an und fiel auf den dritten Platz; Sonnet 5 ging von 67.7% auf 38.9% zurück, vom fünften auf den letzten Platz.
- „Schwieriger“ ist messbar: 2× so großer Korpus (697 → 1,435 Dokumente), 3.7× so viele zitierte Dokumente pro Frage (1.8 → 6.7) und etwa 9× so viel zu lesender Text pro Frage (≈1 MB → ≈9 MB).
- Für Energent-Nutzer gibt es nichts zu konfigurieren: Der Agent ist modellagnostisch, und wenn Ihre Aufgaben wachsen, messen wir, wählen das Modell, das standhält, und sichern Ihnen weiterhin die beste Leistung und Geschwindigkeit.
Hintergrund: OfficeQA, von v1 zu v2
OfficeQA ist der Benchmark von Databricks für quellenbasiertes Schlussfolgern über Finanzberichte des US-Finanzministeriums. v1 ist hier OfficeQA Pro, vorgestellt in der ersten Ankündigung: die 133 im ursprünglichen Benchmark als schwer gekennzeichneten Fragen zu 697 Treasury Bulletins, von Hand durch menschliche Annotatoren verfasst.
v2 ist OfficeQA Pro V2, vorgestellt in der zweiten Ankündigung: 90 Fragen zu 1,435 gescannten Rechnungsbüchern der Bundeseinnahmen und -ausgaben von 1793 bis 2024.
Im direkten Vergleich ist v2 auf jeder Achse schwieriger, die für einen Agenten zählt:
| v1 | v2 | Änderung | |
|---|---|---|---|
| Dokumente im Korpus | 697 | 1,435 | 2× |
| Zitierte Dokumente pro Frage (Mittel) | 1.8 | 6.7 | 3.7× |
| Zu lesender Text pro Frage (Mittel) | ≈1 MB | ≈9 MB | ≈9× |
Nur wenige Benchmarks erhalten eine zweite Ausgabe derselben Aufgabe. OfficeQA hat sie bekommen, und damit wird Schwierigkeit zu einer messbaren Achse.
Wie wir getestet haben
- Warum OfficeQA. Es ähnelt der Arbeit, die unsere Nutzer zu Energent bringen: die richtigen Dokumente finden, Zahlen aus dichten Tabellen ziehen, sie kombinieren und eine exakte, überprüfbare Antwort liefern.
- Gleicher Agent, nur das Modell getauscht. Der Energent-Agent ist modellagnostisch. Mit denselben Tools, Prompts und demselben Schrittbudget liefen sieben Frontier-Modelle von Anthropic, OpenAI und Google auf beiden Ausgaben. Die schwierigeren Daten treiben den Rückgang; da der Agent unverändert bleibt, gehen die Unterschiede zwischen den Modellen darin, wie stark sie abfielen, auf das Modell zurück, nicht auf den Agenten.
- Gleiche Regeln für jedes Modell. Jede Antwort wird vom offiziellen Scorer des Benchmarks bewertet, ein Lauf pro Modell.
Ergebnisse
Genauigkeit, von v1 zu v2
Antwortgenauigkeit nach dem offiziellen Scorer, sortiert nach dem v2-Ergebnis.
| Modell | v1 (133 Fragen) | v2 (90 Fragen) | Änderung |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Auf v1 lagen fünf der sieben Modelle innerhalb einer Spanne von 7 Punkten; auf v2 verteilen sich dieselben sieben über 31 Punkte.
- Die beiden, die standhielten, Fable 5.1 und GPT-5.6 Sol, lagen auf v1 im Mittelfeld und belegen auf v2 die Plätze eins und zwei.
v1: Kosten- und Inferenzprofil
| Modell | Kosten / Frage | Durchschn. Dauer | Modellaufrufe / Frage | Tool-Aufrufe / Frage | Tools pro Aufruf |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: Kosten- und Inferenzprofil
| Modell | Kosten / Frage | Durchschn. Dauer | Modellaufrufe / Frage | Tool-Aufrufe / Frage | Tools pro Aufruf |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Jedes Modell musste auf v2 mehr arbeiten: das 2- bis 3.4-Fache der Kosten pro Frage, das 1.5- bis 2.6-Fache der Modell- und Tool-Aufrufe und die 1.9- bis 4.1-fache Dauer.
- Die beiden, die standhielten, taten es auf unterschiedliche Weise: Fable 5.1 mit den wenigsten Tool-Aufrufen aller Modelle und 3.2 Minuten pro Frage, GPT-5.6 Sol mit den meisten Tool-Aufrufen und 6.9 Minuten.
Fazit
Die beiden Ausgaben von OfficeQA bieten etwas Seltenes: dieselbe Aufgabe auf zwei Schwierigkeitsstufen, sodass sich zeigt, welche Modelle ihre Leistung halten, wenn die Aufgabe schwieriger wird, und welche abfallen. Auf v1 lagen die sieben Modelle dicht beieinander; auf v2 liegen sie weit auseinander. Einfache Daten verbergen die Unterschiede zwischen Modellen, schwierige Daten legen sie offen.
Für Energent-Nutzer bleibt diese Wahl unsere Aufgabe: Wenn Ihre Aufgaben schwieriger werden, messen wir die Modelle an Ihrer Art von Arbeit, wählen das Modell, das standhält, und wägen Genauigkeit gegen Geschwindigkeit und Kosten ab, ohne dass Sie etwas konfigurieren müssen.
Dank
Besonderer Dank gilt dem Databricks-Team für OfficeQA: ein roher, hochwertiger und bewusst schwierigerer Datensatz, aufgebaut auf echten Dokumenten mit sorgfältig verifizierten Fragen und veröffentlicht in zwei Ausgaben derselben Aufgabe. Erst diese Kontinuität hat uns diesen Trend überhaupt sichtbar gemacht. Ein ausführliches Paper zu diesen Ergebnissen ist in Vorbereitung.
Referenzen
- Databricks, Vorstellung von OfficeQA, die Ankündigung der ersten Ausgabe
- Databricks, Vorstellung von OfficeQA Pro V2, die Ankündigung der zweiten Ausgabe
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- OfficeQA-Repository auf GitHub
- Datensatz OfficeQA Pro V2 auf Hugging Face
