Главное
АнонсыБенчмарк

Данные сложнее, агент тот же: насколько упала каждая модель

Более сложные данные Databricks OfficeQA, тот же агент Energent, семь передовых моделей: Fable 5.1 и GPT-5.6 Sol удержались в пределах 3 пунктов, остальные пять упали на 6–29 пунктов.

Команда Energent
Диаграмма со стрелками падения семи моделей от OfficeQA v1 к v2: Fable 5.1 и GPT-5.6 Sol удержались, пять других упали
Открыть диаграмму в полном разрешении

Databricks усложнила OfficeQA, выпустив вторую редакцию. Мы оставили агент Energent без изменений и сравнили одни и те же модели на обеих редакциях. Стрелки на диаграмме выше показывают, сколько потеряла каждая модель между редакциями.

Кратко

  • Две модели удержались: Fable 5.1 (72.2% → 70.0%) и GPT-5.6 Sol (71.4% → 68.9%). Пять упали на 6.5–28.8 пункта.
  • Рейтинг перестроился. Opus 5 лидировала на v1 с 74.4% и опустилась на третье место; Sonnet 5 упала с 67.7% до 38.9%, с пятого места на последнее.
  • «Сложнее» измеримо: корпус в 2× больше (697 → 1,435 документов), цитируемых документов на вопрос в 3.7× больше (1.8 → 6.7) и примерно в 9× больше текста для чтения на вопрос (≈1 МБ → ≈9 МБ).
  • Пользователям Energent ничего настраивать не нужно: агент не зависит от модели, поэтому по мере роста ваших задач мы измеряем, выбираем модель, которая удерживает результат, и сохраняем для вас лучшую точность и скорость.

Предыстория: OfficeQA, от v1 к v2

OfficeQA — бенчмарк Databricks для проверки обоснованных рассуждений по финансовым отчётам Казначейства США. Под v1 здесь понимается OfficeQA Pro, представленный в первом анонсе: 133 вопроса, помеченных как сложные в исходном бенчмарке, по 697 бюллетеням Казначейства, составленных вручную аннотаторами-людьми.

v2 — это OfficeQA Pro V2, представленный во втором анонсе: 90 вопросов по 1,435 отсканированным ведомостям федеральных доходов и расходов с 1793 по 2024 год.

При сопоставлении v2 сложнее по каждой оси, которая важна для агента:

v1v2Изменение
Документов в корпусе6971,435
Цитируемых документов на вопрос (среднее)1.86.73.7×
Текста для чтения на вопрос (среднее)≈1 МБ≈9 МБ≈9×

Мало какие бенчмарки получают вторую редакцию той же задачи. У OfficeQA она есть, и это превращает сложность в ось, вдоль которой можно измерять.

Как мы тестировали

  • Почему OfficeQA. Он похож на работу, с которой наши пользователи приходят в Energent: найти нужные документы, извлечь цифры из плотных таблиц, свести их вместе и вернуть точный ответ, который можно проверить.
  • Тот же агент, меняется только модель. Агент Energent не зависит от модели. Одни и те же инструменты, промпты и бюджет шагов запускали семь передовых моделей от Anthropic, OpenAI и Google на обеих редакциях. Падение вызвано именно более сложными данными; при неизменном агенте различия между моделями в том, насколько сильно они упали, определяются моделью, а не агентом.
  • Одни правила для всех моделей. Каждый ответ оценивается официальным оценщиком бенчмарка, один запуск на модель.

Результаты

Точность, от v1 к v2

Точность ответов по официальному оценщику, отсортировано по результату на v2.

Модельv1 (133 вопр.)v2 (90 вопр.)Изменение
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • На v1 пять из семи моделей укладывались в диапазон 7 пунктов; на v2 те же семь разбросаны на 31 пункт.
  • Две удержавшиеся модели, Fable 5.1 и GPT-5.6 Sol, на v1 были в середине группы, а на v2 финишируют первой и второй.

v1: стоимость и профиль инференса

МодельСтоимость / вопросСредняя длительностьВызовов модели / вопр.Вызовов инструментов / вопр.Инструментов на вызов
Fable 5.1$0.581.7 мин11.610.70.93
GPT-5.6 Sol$0.732.3 мин13.623.91.76
Opus 5$0.491.4 мин9.711.61.20
Fable 5$0.941.6 мин8.511.01.29
GPT-5.6 Terra$0.261.7 мин13.721.61.58
Gemini 3.1 Pro$0.301.3 мин17.816.20.91
Sonnet 5$0.282.2 мин12.314.01.14

v2: стоимость и профиль инференса

МодельСтоимость / вопросСредняя длительностьВызовов модели / вопр.Вызовов инструментов / вопр.Инструментов на вызов
Fable 5.1$1.243.2 мин18.117.60.97
GPT-5.6 Sol$2.126.9 мин24.361.92.55
Opus 5$0.982.7 мин17.019.41.14
Fable 5$2.004.0 мин14.819.51.31
GPT-5.6 Terra$0.633.8 мин20.743.42.10
Gemini 3.1 Pro$1.015.3 мин38.436.90.96
Sonnet 5$0.837.0 мин25.933.01.27
  • Каждая модель работала на v2 тяжелее: в 2–3.4 раза выше стоимость на вопрос, в 1.5–2.6 раза больше вызовов модели и инструментов и в 1.9–4.1 раза дольше.
  • Две удержавшиеся модели добились этого по-разному: Fable 5.1 — с наименьшим числом вызовов инструментов среди всех моделей и 3.2 минуты на вопрос, GPT-5.6 Sol — с наибольшим числом вызовов инструментов и 6.9 минуты.

Вывод

Две редакции OfficeQA дают редкую возможность: одна и та же задача на двух уровнях сложности, так что видно, какие модели продолжают справляться по мере усложнения задачи, а какие проседают. На v1 семь моделей шли плотной группой; на v2 они разошлись далеко друг от друга. Лёгкие данные скрывают различия между моделями, сложные — обнажают их.

Для пользователей Energent этот выбор остаётся за нами: по мере усложнения ваших задач мы измеряем модели на вашем типе работы, выбираем ту, что удерживает результат, и балансируем точность со скоростью и стоимостью — вам ничего настраивать не нужно.

Благодарности

Отдельная благодарность команде Databricks за OfficeQA: сырой, качественный и намеренно более сложный набор данных, построенный на реальных документах с тщательно проверенными вопросами и выпущенный в двух редакциях одной и той же задачи. Именно эта преемственность и позволила нам вообще увидеть эту тенденцию. Подробная статья об этих результатах готовится.

Источники

  1. Databricks, Представляем OfficeQA, анонс первой редакции
  2. Databricks, Представляем OfficeQA Pro V2, анонс второй редакции
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Репозиторий OfficeQA на GitHub
  5. Набор данных OfficeQA Pro V2 на Hugging Face

Решения

Оборудование

ИИ-помощь в проверке CAD и инженерных проектных рабочих процессов.