Databricks усложнила OfficeQA, выпустив вторую редакцию. Мы оставили агент Energent без изменений и сравнили одни и те же модели на обеих редакциях. Стрелки на диаграмме выше показывают, сколько потеряла каждая модель между редакциями.
Кратко
- Две модели удержались: Fable 5.1 (72.2% → 70.0%) и GPT-5.6 Sol (71.4% → 68.9%). Пять упали на 6.5–28.8 пункта.
- Рейтинг перестроился. Opus 5 лидировала на v1 с 74.4% и опустилась на третье место; Sonnet 5 упала с 67.7% до 38.9%, с пятого места на последнее.
- «Сложнее» измеримо: корпус в 2× больше (697 → 1,435 документов), цитируемых документов на вопрос в 3.7× больше (1.8 → 6.7) и примерно в 9× больше текста для чтения на вопрос (≈1 МБ → ≈9 МБ).
- Пользователям Energent ничего настраивать не нужно: агент не зависит от модели, поэтому по мере роста ваших задач мы измеряем, выбираем модель, которая удерживает результат, и сохраняем для вас лучшую точность и скорость.
Предыстория: OfficeQA, от v1 к v2
OfficeQA — бенчмарк Databricks для проверки обоснованных рассуждений по финансовым отчётам Казначейства США. Под v1 здесь понимается OfficeQA Pro, представленный в первом анонсе: 133 вопроса, помеченных как сложные в исходном бенчмарке, по 697 бюллетеням Казначейства, составленных вручную аннотаторами-людьми.
v2 — это OfficeQA Pro V2, представленный во втором анонсе: 90 вопросов по 1,435 отсканированным ведомостям федеральных доходов и расходов с 1793 по 2024 год.
При сопоставлении v2 сложнее по каждой оси, которая важна для агента:
| v1 | v2 | Изменение | |
|---|---|---|---|
| Документов в корпусе | 697 | 1,435 | 2× |
| Цитируемых документов на вопрос (среднее) | 1.8 | 6.7 | 3.7× |
| Текста для чтения на вопрос (среднее) | ≈1 МБ | ≈9 МБ | ≈9× |
Мало какие бенчмарки получают вторую редакцию той же задачи. У OfficeQA она есть, и это превращает сложность в ось, вдоль которой можно измерять.
Как мы тестировали
- Почему OfficeQA. Он похож на работу, с которой наши пользователи приходят в Energent: найти нужные документы, извлечь цифры из плотных таблиц, свести их вместе и вернуть точный ответ, который можно проверить.
- Тот же агент, меняется только модель. Агент Energent не зависит от модели. Одни и те же инструменты, промпты и бюджет шагов запускали семь передовых моделей от Anthropic, OpenAI и Google на обеих редакциях. Падение вызвано именно более сложными данными; при неизменном агенте различия между моделями в том, насколько сильно они упали, определяются моделью, а не агентом.
- Одни правила для всех моделей. Каждый ответ оценивается официальным оценщиком бенчмарка, один запуск на модель.
Результаты
Точность, от v1 к v2
Точность ответов по официальному оценщику, отсортировано по результату на v2.
| Модель | v1 (133 вопр.) | v2 (90 вопр.) | Изменение |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- На v1 пять из семи моделей укладывались в диапазон 7 пунктов; на v2 те же семь разбросаны на 31 пункт.
- Две удержавшиеся модели, Fable 5.1 и GPT-5.6 Sol, на v1 были в середине группы, а на v2 финишируют первой и второй.
v1: стоимость и профиль инференса
| Модель | Стоимость / вопрос | Средняя длительность | Вызовов модели / вопр. | Вызовов инструментов / вопр. | Инструментов на вызов |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 мин | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 мин | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 мин | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 мин | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 мин | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 мин | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 мин | 12.3 | 14.0 | 1.14 |
v2: стоимость и профиль инференса
| Модель | Стоимость / вопрос | Средняя длительность | Вызовов модели / вопр. | Вызовов инструментов / вопр. | Инструментов на вызов |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 мин | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 мин | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 мин | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 мин | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 мин | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 мин | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 мин | 25.9 | 33.0 | 1.27 |
- Каждая модель работала на v2 тяжелее: в 2–3.4 раза выше стоимость на вопрос, в 1.5–2.6 раза больше вызовов модели и инструментов и в 1.9–4.1 раза дольше.
- Две удержавшиеся модели добились этого по-разному: Fable 5.1 — с наименьшим числом вызовов инструментов среди всех моделей и 3.2 минуты на вопрос, GPT-5.6 Sol — с наибольшим числом вызовов инструментов и 6.9 минуты.
Вывод
Две редакции OfficeQA дают редкую возможность: одна и та же задача на двух уровнях сложности, так что видно, какие модели продолжают справляться по мере усложнения задачи, а какие проседают. На v1 семь моделей шли плотной группой; на v2 они разошлись далеко друг от друга. Лёгкие данные скрывают различия между моделями, сложные — обнажают их.
Для пользователей Energent этот выбор остаётся за нами: по мере усложнения ваших задач мы измеряем модели на вашем типе работы, выбираем ту, что удерживает результат, и балансируем точность со скоростью и стоимостью — вам ничего настраивать не нужно.
Благодарности
Отдельная благодарность команде Databricks за OfficeQA: сырой, качественный и намеренно более сложный набор данных, построенный на реальных документах с тщательно проверенными вопросами и выпущенный в двух редакциях одной и той же задачи. Именно эта преемственность и позволила нам вообще увидеть эту тенденцию. Подробная статья об этих результатах готовится.
Источники
- Databricks, Представляем OfficeQA, анонс первой редакции
- Databricks, Представляем OfficeQA Pro V2, анонс второй редакции
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Репозиторий OfficeQA на GitHub
- Набор данных OfficeQA Pro V2 на Hugging Face
