Databricks, ikinci bir sürümle OfficeQA’yı daha da zorlaştırdı. Biz Energent ajanını sabit tuttuk ve aynı modelleri her iki sürümde karşılaştırdık. Yukarıdaki grafikteki oklar, her modelin sürümler arasında ne kaybettiğini gösteriyor.
Özet
- İki model tutundu: Fable 5.1 (72.2% → 70.0%) ve GPT-5.6 Sol (71.4% → 68.9%). Beş model 6.5 ile 28.8 puan arasında geriledi.
- Sıralama değişti. Opus 5, v1’de 74.4% ile liderdi ve üçüncülüğe geriledi; Sonnet 5, 67.7%’den 38.9%’a gerileyerek beşincilikten sonunculuğa düştü.
- “Daha zor” ölçülebilir bir nitelik: derlem 2× (697 → 1,435 belge), soru başına atıf yapılan belge 3.7× (1.8 → 6.7) ve soru başına okunacak metin yaklaşık 9× (≈1 MB → ≈9 MB).
- Energent kullanıcıları için yapılandırılacak bir şey yok: ajan modelden bağımsız olduğundan, görevleriniz büyüdükçe biz ölçer, tutunan modeli seçer ve en iyi performansı ve hızı sizin için koruruz.
Arka plan: OfficeQA, v1’den v2’ye
OfficeQA, Databricks’in ABD Hazinesi mali raporları üzerinde kaynağa dayalı muhakeme için hazırladığı benchmarktır. Buradaki v1, ilk duyuruda tanıtılan OfficeQA Pro: özgün benchmarkta zor olarak etiketlenen, 697 Hazine Bülteni üzerinde insan etiketleyiciler tarafından elle yazılmış 133 soru.
v2 ise ikinci duyuruda tanıtılan OfficeQA Pro V2: 1793 ile 2024 yılları arasındaki federal gelir ve giderlere ait 1,435 taranmış defter üzerinde 90 soru.
Yan yana koyulduğunda v2, bir ajan için önemli olan her eksende daha zor:
| v1 | v2 | Değişim | |
|---|---|---|---|
| Derlemdeki belge sayısı | 697 | 1,435 | 2× |
| Soru başına atıf yapılan belge (ortalama) | 1.8 | 6.7 | 3.7× |
| Soru başına okunacak metin (ortalama) | ≈1 MB | ≈9 MB | ≈9× |
Çok az benchmark aynı görevin ikinci bir sürümünü alır. OfficeQA aldı ve bu, zorluğu üzerinde ölçüm yapılabilen bir eksen haline getiriyor.
Nasıl test ettik
- Neden OfficeQA. Kullanıcılarımızın Energent’e getirdiği işe benziyor: doğru belgeleri bulmak, yoğun tablolardan rakamları çekmek, bunları birleştirmek ve doğrulanabilir kesin bir yanıt vermek.
- Aynı ajan, yalnızca model değişti. Energent ajanı modelden bağımsızdır. Aynı araçlar, istemler ve adım bütçesiyle Anthropic, OpenAI ve Google’ın yedi öncü modeli her iki sürümde çalıştırıldı. Düşüşü tetikleyen, daha zor veridir; ajan sabit tutulduğunda, modellerin ne kadar gerilediğindeki farklar ajana değil modele bağlıdır.
- Her model için aynı kurallar. Her yanıt, benchmarkın resmî puanlayıcısıyla puanlanır; model başına tek çalıştırma.
Sonuçlar
Doğruluk, v1’den v2’ye
Resmî puanlayıcıya göre yanıt doğruluğu, v2 puanına göre sıralı.
| Model | v1 (133 soru) | v2 (90 soru) | Değişim |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- v1’de yedi modelin beşi 7 puanlık bir bantta toplanmıştı; v2’de aynı yedi model 31 puanlık bir aralığa yayılıyor.
- Tutunan iki model, Fable 5.1 ve GPT-5.6 Sol, v1’de orta sıralardaydı; v2’de birinci ve ikinci sırada bitiriyor.
v1: maliyet ve çıkarım profili
| Model | Maliyet / soru | Ort. süre | Model çağrısı / soru | Araç çağrısı / soru | Çağrı başına araç |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 dk | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 dk | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 dk | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 dk | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 dk | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 dk | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 dk | 12.3 | 14.0 | 1.14 |
v2: maliyet ve çıkarım profili
| Model | Maliyet / soru | Ort. süre | Model çağrısı / soru | Araç çağrısı / soru | Çağrı başına araç |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 dk | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 dk | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 dk | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 dk | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 dk | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 dk | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 dk | 25.9 | 33.0 | 1.27 |
- Her model v2’de daha çok çalıştı: soru başına maliyet 2 ile 3.4 katına, model ve araç çağrıları 1.5 ile 2.6 katına çıktı ve süre 1.9 ile 4.1 kat uzadı.
- Tutunan iki model bunu farklı yollarla başardı: Fable 5.1 tüm modeller arasında en az araç çağrısı ve soru başına 3.2 dakikayla, GPT-5.6 Sol ise en çok araç çağrısı ve 6.9 dakikayla.
Sonuç
OfficeQA’nın iki sürümü nadir bir şey sunuyor: aynı görevin iki zorluk düzeyi; böylece görev zorlaştıkça hangi modellerin performansını koruduğunu, hangilerinin düştüğünü görebilirsiniz. v1’de yedi model birbirine yakın kümelenmişti; v2’de aralarındaki mesafe iyice açıldı. Kolay veri modeller arasındaki farkları gizler, zor veri ise ortaya çıkarır.
Energent kullanıcıları için bu seçimi yapmaya devam etmek bizim işimiz: görevleriniz zorlaştıkça modelleri sizin yaptığınız türden işler üzerinde ölçer, tutunanı seçer ve doğruluğu hız ve maliyetle dengeleriz; sizin yapılandırmanız gereken hiçbir şey yok.
Teşekkür
OfficeQA için Databricks ekibine özel teşekkürler: gerçek belgeler üzerine, özenle doğrulanmış sorularla inşa edilmiş ve aynı görevin iki sürümü olarak yayımlanmış ham, yüksek kaliteli ve bilinçli olarak daha zor bir veri kümesi. Bu eğilimi görebilmemizi sağlayan da tam olarak bu süreklilik oldu. Bu sonuçlara ilişkin ayrıntılı bir makale hazırlanıyor.
Kaynaklar
- Databricks, OfficeQA’yı tanıtıyoruz, birinci sürüm duyurusu
- Databricks, OfficeQA Pro V2’yi tanıtıyoruz, ikinci sürüm duyurusu
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- GitHub’daki OfficeQA deposu
- Hugging Face’teki OfficeQA Pro V2 veri kümesi
