Databricks ने दूसरे संस्करण के साथ OfficeQA को और कठिन बना दिया। हमने Energent एजेंट को स्थिर रखा और दोनों संस्करणों पर वही मॉडल तुलना किए। ऊपर दिए चार्ट के तीर दिखाते हैं कि हर मॉडल ने दोनों संस्करणों के बीच कितना खोया।
संक्षेप में
- दो मॉडल टिके रहे: Fable 5.1 (72.2% → 70.0%) और GPT-5.6 Sol (71.4% → 68.9%)। पाँच मॉडल 6.5 से 28.8 अंक गिरे।
- रैंकिंग बदल गई। Opus 5 v1 में 74.4% के साथ शीर्ष पर था और तीसरे स्थान पर खिसक गया; Sonnet 5 67.7% से 38.9% पर आ गया, पाँचवें से आख़िरी स्थान पर।
- "कठिन" मापने योग्य है: 2× कॉर्पस (697 → 1,435 दस्तावेज़), प्रति प्रश्न 3.7× उद्धृत दस्तावेज़ (1.8 → 6.7), और प्रति प्रश्न पढ़ने के लिए लगभग 9× टेक्स्ट (≈1 MB → ≈9 MB)।
- Energent उपयोगकर्ताओं के लिए कुछ भी कॉन्फ़िगर करने की ज़रूरत नहीं: एजेंट मॉडल-निरपेक्ष है, इसलिए जैसे-जैसे आपके कार्य बढ़ते हैं, हम मापते हैं, टिकने वाला मॉडल चुनते हैं, और आपके लिए सर्वश्रेष्ठ प्रदर्शन और गति बनाए रखते हैं।
पृष्ठभूमि: OfficeQA, v1 से v2
OfficeQA अमेरिकी ट्रेज़री की वित्तीय रिपोर्टों पर ग्राउंडेड रीज़निंग के लिए Databricks का बेंचमार्क है। यहाँ v1 का अर्थ OfficeQA Pro है, जिसे पहली घोषणा में पेश किया गया था: मूल बेंचमार्क में कठिन के रूप में लेबल किए गए 133 प्रश्न, 697 ट्रेज़री बुलेटिन पर, जिन्हें मानव एनोटेटरों ने हाथ से लिखा था।
v2 OfficeQA Pro V2 है, जिसे दूसरी घोषणा में पेश किया गया: 1793 से 2024 तक की संघीय प्राप्तियों और व्ययों के 1,435 स्कैन किए गए बहीखातों पर 90 प्रश्न।
आमने-सामने रखने पर, v2 हर उस धुरी पर कठिन है जो एक एजेंट के लिए मायने रखती है:
| v1 | v2 | बदलाव | |
|---|---|---|---|
| कॉर्पस में दस्तावेज़ | 697 | 1,435 | 2× |
| प्रति प्रश्न उद्धृत दस्तावेज़ (औसत) | 1.8 | 6.7 | 3.7× |
| प्रति प्रश्न पढ़ने योग्य टेक्स्ट (औसत) | ≈1 MB | ≈9 MB | ≈9× |
बहुत कम बेंचमार्क को एक ही कार्य का दूसरा संस्करण मिलता है। OfficeQA को मिला, जिससे कठिनाई एक ऐसी धुरी बन जाती है जिस पर आप माप सकते हैं।
हमने कैसे परीक्षण किया
- OfficeQA क्यों। यह उस काम जैसा दिखता है जो हमारे उपयोगकर्ता Energent पर लाते हैं: सही दस्तावेज़ ढूँढना, सघन तालिकाओं से आँकड़े निकालना, उन्हें जोड़ना, और एक सटीक उत्तर देना जिसे जाँचा जा सके।
- वही एजेंट, केवल मॉडल बदला। Energent एजेंट मॉडल-निरपेक्ष है। वही टूल, प्रॉम्प्ट और स्टेप बजट ने दोनों संस्करणों पर Anthropic, OpenAI और Google के सात फ्रंटियर मॉडल चलाए। गिरावट का कारण कठिन डेटा है; एजेंट स्थिर होने पर, मॉडल कितना गिरे इसमें अंतर मॉडल के कारण है, एजेंट के नहीं।
- हर मॉडल के लिए वही नियम। हर उत्तर को बेंचमार्क के आधिकारिक स्कोरर से स्कोर किया गया, प्रति मॉडल एक रन।
परिणाम
सटीकता, v1 से v2
आधिकारिक स्कोरर के अनुसार उत्तर सटीकता, v2 स्कोर के क्रम में।
| मॉडल | v1 (133 प्रश्न) | v2 (90 प्रश्न) | बदलाव |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- v1 पर, सात में से पाँच मॉडल 7 अंकों के दायरे में थे; v2 पर वही सात 31 अंकों में फैले हैं।
- जो दो टिके रहे, Fable 5.1 और GPT-5.6 Sol, v1 पर बीच में थे और v2 पर पहले और दूसरे स्थान पर रहे।
v1: लागत और इन्फ़रेंस प्रोफ़ाइल
| मॉडल | लागत / प्रश्न | औसत अवधि | मॉडल कॉल / प्रश्न | टूल कॉल / प्रश्न | प्रति कॉल टूल |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 मिनट | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 मिनट | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 मिनट | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 मिनट | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 मिनट | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 मिनट | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 मिनट | 12.3 | 14.0 | 1.14 |
v2: लागत और इन्फ़रेंस प्रोफ़ाइल
| मॉडल | लागत / प्रश्न | औसत अवधि | मॉडल कॉल / प्रश्न | टूल कॉल / प्रश्न | प्रति कॉल टूल |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 मिनट | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 मिनट | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 मिनट | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 मिनट | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 मिनट | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 मिनट | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 मिनट | 25.9 | 33.0 | 1.27 |
- हर मॉडल ने v2 पर अधिक मेहनत की: प्रति प्रश्न 2 से 3.4 गुना लागत, 1.5 से 2.6 गुना मॉडल और टूल कॉल, और 1.9 से 4.1 गुना समय।
- जो दो टिके रहे, उन्होंने यह अलग-अलग तरीके से किया: Fable 5.1 ने सभी मॉडलों में सबसे कम टूल कॉल और प्रति प्रश्न 3.2 मिनट के साथ, GPT-5.6 Sol ने सबसे अधिक टूल कॉल और 6.9 मिनट के साथ।
निष्कर्ष
OfficeQA के दो संस्करण कुछ दुर्लभ पेश करते हैं: कठिनाई के दो स्तरों पर वही कार्य, ताकि आप देख सकें कि कार्य कठिन होने पर कौन से मॉडल प्रदर्शन बनाए रखते हैं और कौन से गिरते हैं। v1 पर सातों मॉडल एक साथ गुच्छे में थे; v2 पर वे दूर-दूर फैल गए। आसान डेटा मॉडलों के बीच के अंतर छिपाता है, कठिन डेटा उन्हें उजागर करता है।
Energent उपयोगकर्ताओं के लिए, यह चुनाव करते रहना हमारा काम है: जैसे-जैसे आपके कार्य कठिन होते हैं, हम आपके तरह के काम पर मॉडलों को मापते हैं, टिकने वाला मॉडल चुनते हैं, और सटीकता को गति और लागत के साथ संतुलित करते हैं, बिना आपके कुछ भी कॉन्फ़िगर किए।
आभार
OfficeQA के लिए Databricks टीम का विशेष आभार: एक कच्चा, उच्च-गुणवत्ता वाला और जान-बूझकर कठिन बनाया गया डेटासेट, जो वास्तविक दस्तावेज़ों पर सावधानीपूर्वक सत्यापित प्रश्नों के साथ बना है, और एक ही कार्य के दो संस्करणों में जारी किया गया है। यही निरंतरता है जिसने हमें यह रुझान देखने दिया। इन परिणामों पर एक विस्तृत पेपर तैयार किया जा रहा है।
संदर्भ
- Databricks, OfficeQA का परिचय, पहले संस्करण की घोषणा
- Databricks, OfficeQA Pro V2 का परिचय, दूसरे संस्करण की घोषणा
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- GitHub पर OfficeQA रिपॉज़िटरी
- Hugging Face पर OfficeQA Pro V2 डेटासेट
