Databricks teki OfficeQA:sta vaikeamman toisella painoksella. Pidimme Energent-agentin muuttumattomana ja vertasimme samoja malleja molemmilla painoksilla. Yllä olevan kaavion nuolet näyttävät, mitä kukin malli menetti painosten välillä.
Tiivistelmä
- Kaksi mallia piti pintansa: Fable 5.1 (72.2% → 70.0%) ja GPT-5.6 Sol (71.4% → 68.9%). Viisi putosi 6.5–28.8 pistettä.
- Järjestys meni uusiksi. Opus 5 johti v1:tä tuloksella 74.4% ja putosi kolmanneksi; Sonnet 5 putosi tuloksesta 67.7% tulokseen 38.9%, viidenneltä sijalta viimeiseksi.
- ”Vaikeampi” on mitattavissa: korpus on 2× suurempi (697 → 1,435 asiakirjaa), siteerattuja asiakirjoja kysymystä kohden on 3.7× enemmän (1.8 → 6.7) ja luettavaa tekstiä kysymystä kohden noin 9× enemmän (≈1 MB → ≈9 MB).
- Energentin käyttäjille ei ole mitään määritettävää: agentti on malliriippumaton, joten tehtäviesi kasvaessa me mittaamme, valitsemme mallin, joka pitää pintansa, ja säilytämme sinulle parhaan suorituskyvyn ja nopeuden.
Tausta: OfficeQA, v1:stä v2:een
OfficeQA on Databricksin vertailutesti lähteisiin perustuvalle päättelylle Yhdysvaltain valtiovarainministeriön talousraporteista. v1 tarkoittaa tässä OfficeQA Pro -testiä, joka esiteltiin ensimmäisessä julkistuksessa: alkuperäisen vertailutestin 133 vaikeaksi luokiteltua kysymystä 697 Treasury Bulletin -julkaisusta, ihmisannotoijien käsin laatimina.
v2 on OfficeQA Pro V2, joka esiteltiin toisessa julkistuksessa: 90 kysymystä 1,435 skannatusta liittovaltion tulojen ja menojen tilikirjasta vuosilta 1793–2024.
Rinnakkain tarkasteltuna v2 on vaikeampi jokaisella agentin kannalta merkitsevällä akselilla:
| v1 | v2 | Muutos | |
|---|---|---|---|
| Asiakirjoja korpuksessa | 697 | 1,435 | 2× |
| Siteerattuja asiakirjoja kysymystä kohden (keskiarvo) | 1.8 | 6.7 | 3.7× |
| Luettavaa tekstiä kysymystä kohden (keskiarvo) | ≈1 MB | ≈9 MB | ≈9× |
Harva vertailutesti saa samasta tehtävästä toisen painoksen. OfficeQA sai, mikä tekee vaikeudesta akselin, jota pitkin voi mitata.
Miten testasimme
- Miksi OfficeQA. Se muistuttaa työtä, jota käyttäjämme tuovat Energentiin: etsi oikeat asiakirjat, poimi luvut tiheistä taulukoista, yhdistä ne ja palauta tarkka vastaus, joka voidaan tarkistaa.
- Sama agentti, vain malli vaihdettu. Energent-agentti on malliriippumaton. Samat työkalut, kehotteet ja askelbudjetti ajoivat seitsemän Anthropicin, OpenAI:n ja Googlen huippumallia molemmilla painoksilla. Pudotuksen aiheuttaa vaikeampi data; kun agentti on kiinnitetty, mallien väliset erot siinä, kuinka paljon ne putosivat, johtuvat mallista, eivät agentista.
- Samat säännöt jokaiselle mallille. Jokainen vastaus pisteytetään vertailutestin virallisella arvioijalla, yksi ajo mallia kohden.
Tulokset
Tarkkuus, v1:stä v2:een
Vastausten tarkkuus virallisella arvioijalla, järjestettynä v2-tuloksen mukaan.
| Malli | v1 (133 kys.) | v2 (90 kys.) | Muutos |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- v1:ssä viisi seitsemästä mallista mahtui 7 pisteen kaistaan; v2:ssa samat seitsemän hajaantuvat 31 pisteen alueelle.
- Kaksi pintansa pitänyttä, Fable 5.1 ja GPT-5.6 Sol, olivat v1:ssä keskikastia ja sijoittuvat v2:ssa ensimmäiseksi ja toiseksi.
v1: kustannus- ja inferenssiprofiili
| Malli | Kustannus / kysymys | Keskim. kesto | Mallikutsuja / kys. | Työkalukutsuja / kys. | Työkaluja / kutsu |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: kustannus- ja inferenssiprofiili
| Malli | Kustannus / kysymys | Keskim. kesto | Mallikutsuja / kys. | Työkalukutsuja / kys. | Työkaluja / kutsu |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Jokainen malli teki v2:ssa enemmän työtä: 2–3.4-kertainen kustannus kysymystä kohden, 1.5–2.6-kertainen määrä malli- ja työkalukutsuja ja 1.9–4.1-kertainen kesto.
- Kaksi pintansa pitänyttä tekivät sen eri tavoin: Fable 5.1 käytti kaikista malleista vähiten työkalukutsuja ja 3.2 minuuttia kysymystä kohden, GPT-5.6 Sol eniten työkalukutsuja ja 6.9 minuuttia.
Johtopäätös
OfficeQA:n kaksi painosta tarjoavat jotain harvinaista: saman tehtävän kahdella vaikeustasolla, joten voi nähdä, mitkä mallit jatkavat suoriutumista tehtävän vaikeutuessa ja mitkä putoavat. v1:ssä seitsemän mallia oli tiiviisti yhdessä; v2:ssa ne hajaantuivat kauas toisistaan. Helppo data kätkee mallien väliset erot, vaikea data paljastaa ne.
Energentin käyttäjille tämä valinta on meidän tehtävämme jatkossakin: tehtäviesi vaikeutuessa mittaamme mallit sinun kaltaisellasi työllä, valitsemme sen, joka pitää pintansa, ja tasapainotamme tarkkuuden nopeuden ja kustannusten kanssa ilman, että sinun tarvitsee määrittää mitään.
Kiitokset
Erityiskiitos Databricksin tiimille OfficeQA:sta: raaka, korkealaatuinen ja tarkoituksella vaikeampi aineisto, joka on rakennettu aidoista asiakirjoista huolellisesti varmennetuin kysymyksin ja julkaistu saman tehtävän kahtena painoksena. Juuri tuo jatkuvuus teki tämän trendin näkemisen ylipäätään mahdolliseksi. Yksityiskohtainen artikkeli näistä tuloksista on valmisteilla.
Lähteet
- Databricks, Esittelyssä OfficeQA, ensimmäisen painoksen julkistus
- Databricks, Esittelyssä OfficeQA Pro V2, toisen painoksen julkistus
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- OfficeQA-arkisto GitHubissa
- OfficeQA Pro V2 -aineisto Hugging Facessa
