Najważniejsze informacje
OgłoszeniaBenchmark

Trudniejsze dane, ten sam agent: o ile spadł każdy model

Trudniejsze dane Databricks OfficeQA, ten sam agent Energent, siedem czołowych modeli: Fable 5.1 i GPT-5.6 Sol utrzymały się w granicach 3 punktów, pozostałe pięć spadło o 6 do 29.

Zespół Energent
Wykres strzałek spadku siedmiu modeli od OfficeQA v1 do v2: Fable 5.1 i GPT-5.6 Sol utrzymały się, pięć pozostałych spadło
Otwórz wykres w pełnej rozdzielczości

Databricks utrudnił OfficeQA, wydając drugą edycję. Utrzymaliśmy agenta Energent bez zmian i porównaliśmy te same modele na obu edycjach. Strzałki na powyższym wykresie pokazują, ile każdy model stracił między edycjami.

W skrócie

  • Dwa modele utrzymały poziom: Fable 5.1 (72.2% → 70.0%) i GPT-5.6 Sol (71.4% → 68.9%). Pięć spadło o 6.5 do 28.8 punktu.
  • Ranking się przetasował. Opus 5 prowadził w v1 z wynikiem 74.4% i spadł na trzecie miejsce; Sonnet 5 spadł z 67.7% do 38.9%, z piątego na ostatnie miejsce.
  • „Trudniejsze” da się zmierzyć: 2× większy korpus (697 → 1,435 dokumentów), 3.7× więcej dokumentów cytowanych na pytanie (1.8 → 6.7) i około 9× więcej tekstu do przeczytania na pytanie (≈1 MB → ≈9 MB).
  • Dla użytkowników Energent nie ma nic do konfigurowania: agent jest niezależny od modelu, więc w miarę jak Twoje zadania rosną, mierzymy, wybieramy model, który się utrzymuje, i zapewniamy Ci najlepszą skuteczność i szybkość.

Kontekst: OfficeQA, od v1 do v2

OfficeQA to benchmark Databricks dotyczący rozumowania opartego na źródłach na raportach finansowych Departamentu Skarbu USA. v1 oznacza tu OfficeQA Pro, wprowadzony w pierwszym ogłoszeniu: 133 pytania oznaczone jako trudne w pierwotnym benchmarku, dotyczące 697 biuletynów Departamentu Skarbu (Treasury Bulletins), napisane ręcznie przez ludzkich anotatorów.

v2 to OfficeQA Pro V2, wprowadzony w drugim ogłoszeniu: 90 pytań dotyczących 1,435 zeskanowanych ksiąg federalnych wpływów i wydatków obejmujących lata od 1793 do 2024.

W bezpośrednim zestawieniu v2 jest trudniejsza na każdej osi, która ma znaczenie dla agenta:

v1v2Zmiana
Dokumenty w korpusie6971,435
Dokumenty cytowane na pytanie (średnia)1.86.73.7×
Tekst do przeczytania na pytanie (średnia)≈1 MB≈9 MB≈9×

Niewiele benchmarków doczekuje się drugiej edycji tego samego zadania. OfficeQA się doczekał, dzięki czemu trudność staje się osią, wzdłuż której można mierzyć.

Jak testowaliśmy

  • Dlaczego OfficeQA. Przypomina pracę, z którą nasi użytkownicy przychodzą do Energent: znaleźć właściwe dokumenty, wyciągnąć liczby z gęstych tabel, połączyć je i zwrócić dokładną odpowiedź, którą można sprawdzić.
  • Ten sam agent, wymieniony tylko model. Agent Energent jest niezależny od modelu. Z tymi samymi narzędziami, promptami i budżetem kroków uruchomiliśmy siedem czołowych modeli od Anthropic, OpenAI i Google na obu edycjach. To trudniejsze dane napędzają spadek; przy niezmienionym agencie różnice między modelami w tym, jak bardzo spadły, sprowadzają się do modelu, a nie do agenta.
  • Te same zasady dla każdego modelu. Każda odpowiedź jest oceniana przez oficjalny mechanizm oceny benchmarku, jeden przebieg na model.

Wyniki

Trafność, od v1 do v2

Trafność odpowiedzi według oficjalnego mechanizmu oceny, posortowana według wyniku v2.

Modelv1 (133 pyt.)v2 (90 pyt.)Zmiana
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • W v1 pięć z siedmiu modeli mieściło się w przedziale 7 punktów; w v2 tych samych siedem rozciąga się na 31 punktów.
  • Dwa modele, które się utrzymały, Fable 5.1 i GPT-5.6 Sol, były w v1 w środku stawki, a w v2 kończą na pierwszym i drugim miejscu.

v1: koszt i profil inferencji

ModelKoszt / pytanieŚr. czas trwaniaWywołania modelu / pyt.Wywołania narzędzi / pyt.Narzędzia na wywołanie
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: koszt i profil inferencji

ModelKoszt / pytanieŚr. czas trwaniaWywołania modelu / pyt.Wywołania narzędzi / pyt.Narzędzia na wywołanie
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Każdy model pracował ciężej w v2: od 2 do 3.4 razy wyższy koszt na pytanie, od 1.5 do 2.6 razy więcej wywołań modelu i narzędzi oraz od 1.9 do 4.1 razy dłużej.
  • Dwa modele, które się utrzymały, zrobiły to inaczej: Fable 5.1 z najmniejszą liczbą wywołań narzędzi spośród wszystkich modeli i 3.2 minuty na pytanie, GPT-5.6 Sol z największą liczbą wywołań narzędzi i 6.9 minuty.

Wnioski

Dwie edycje OfficeQA oferują coś rzadkiego: to samo zadanie na dwóch poziomach trudności, dzięki czemu widać, które modele utrzymują skuteczność, gdy zadanie staje się trudniejsze, a które spadają. W v1 siedem modeli było skupionych blisko siebie; w v2 rozproszyły się daleko od siebie. Łatwe dane ukrywają różnice między modelami, trudne dane je ujawniają.

Dla użytkowników Energent ten wybór pozostaje po naszej stronie: gdy Twoje zadania stają się trudniejsze, mierzymy modele na Twoim rodzaju pracy, wybieramy ten, który się utrzymuje, i równoważymy trafność z szybkością i kosztem, a Ty nie musisz niczego konfigurować.

Podziękowania

Szczególne podziękowania dla zespołu Databricks za OfficeQA: surowy, wysokiej jakości i celowo trudniejszy zbiór danych, zbudowany na prawdziwych dokumentach ze starannie zweryfikowanymi pytaniami i wydany w dwóch edycjach tego samego zadania. To właśnie ta ciągłość pozwoliła nam w ogóle dostrzec ten trend. Szczegółowa publikacja na temat tych wyników jest w przygotowaniu.

Źródła

  1. Databricks, Przedstawiamy OfficeQA, ogłoszenie pierwszej edycji
  2. Databricks, Przedstawiamy OfficeQA Pro V2, ogłoszenie drugiej edycji
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Repozytorium OfficeQA na GitHubie
  5. Zbiór danych OfficeQA Pro V2 na Hugging Face

Rozwiązania

Sprzęt

Wspomagane przez AI przeglądy CAD i przepływy pracy projektowania inżynieryjnego.