हाइलाइट्स
घोषणाएँबेंचमार्क

कठिन डेटा, वही एजेंट: हर मॉडल कितना गिरा

कठिन Databricks OfficeQA डेटा, वही Energent एजेंट, सात फ्रंटियर मॉडल: Fable 5.1 और GPT-5.6 Sol 3 अंकों के भीतर टिके रहे, बाकी पाँच 6 से 29 अंक गिरे।

Energent टीम
OfficeQA v1 से v2 तक सात मॉडलों का ड्रॉप-ऐरो चार्ट: Fable 5.1 और GPT-5.6 Sol टिके रहे, बाकी पाँच गिरे
पूर्ण रिज़ॉल्यूशन चार्ट खोलें

Databricks ने दूसरे संस्करण के साथ OfficeQA को और कठिन बना दिया। हमने Energent एजेंट को स्थिर रखा और दोनों संस्करणों पर वही मॉडल तुलना किए। ऊपर दिए चार्ट के तीर दिखाते हैं कि हर मॉडल ने दोनों संस्करणों के बीच कितना खोया।

संक्षेप में

  • दो मॉडल टिके रहे: Fable 5.1 (72.2% → 70.0%) और GPT-5.6 Sol (71.4% → 68.9%)। पाँच मॉडल 6.5 से 28.8 अंक गिरे।
  • रैंकिंग बदल गई। Opus 5 v1 में 74.4% के साथ शीर्ष पर था और तीसरे स्थान पर खिसक गया; Sonnet 5 67.7% से 38.9% पर आ गया, पाँचवें से आख़िरी स्थान पर।
  • "कठिन" मापने योग्य है: 2× कॉर्पस (697 → 1,435 दस्तावेज़), प्रति प्रश्न 3.7× उद्धृत दस्तावेज़ (1.8 → 6.7), और प्रति प्रश्न पढ़ने के लिए लगभग 9× टेक्स्ट (≈1 MB → ≈9 MB)।
  • Energent उपयोगकर्ताओं के लिए कुछ भी कॉन्फ़िगर करने की ज़रूरत नहीं: एजेंट मॉडल-निरपेक्ष है, इसलिए जैसे-जैसे आपके कार्य बढ़ते हैं, हम मापते हैं, टिकने वाला मॉडल चुनते हैं, और आपके लिए सर्वश्रेष्ठ प्रदर्शन और गति बनाए रखते हैं।

पृष्ठभूमि: OfficeQA, v1 से v2

OfficeQA अमेरिकी ट्रेज़री की वित्तीय रिपोर्टों पर ग्राउंडेड रीज़निंग के लिए Databricks का बेंचमार्क है। यहाँ v1 का अर्थ OfficeQA Pro है, जिसे पहली घोषणा में पेश किया गया था: मूल बेंचमार्क में कठिन के रूप में लेबल किए गए 133 प्रश्न, 697 ट्रेज़री बुलेटिन पर, जिन्हें मानव एनोटेटरों ने हाथ से लिखा था।

v2 OfficeQA Pro V2 है, जिसे दूसरी घोषणा में पेश किया गया: 1793 से 2024 तक की संघीय प्राप्तियों और व्ययों के 1,435 स्कैन किए गए बहीखातों पर 90 प्रश्न।

आमने-सामने रखने पर, v2 हर उस धुरी पर कठिन है जो एक एजेंट के लिए मायने रखती है:

v1v2बदलाव
कॉर्पस में दस्तावेज़6971,435
प्रति प्रश्न उद्धृत दस्तावेज़ (औसत)1.86.73.7×
प्रति प्रश्न पढ़ने योग्य टेक्स्ट (औसत)≈1 MB≈9 MB≈9×

बहुत कम बेंचमार्क को एक ही कार्य का दूसरा संस्करण मिलता है। OfficeQA को मिला, जिससे कठिनाई एक ऐसी धुरी बन जाती है जिस पर आप माप सकते हैं।

हमने कैसे परीक्षण किया

  • OfficeQA क्यों। यह उस काम जैसा दिखता है जो हमारे उपयोगकर्ता Energent पर लाते हैं: सही दस्तावेज़ ढूँढना, सघन तालिकाओं से आँकड़े निकालना, उन्हें जोड़ना, और एक सटीक उत्तर देना जिसे जाँचा जा सके।
  • वही एजेंट, केवल मॉडल बदला। Energent एजेंट मॉडल-निरपेक्ष है। वही टूल, प्रॉम्प्ट और स्टेप बजट ने दोनों संस्करणों पर Anthropic, OpenAI और Google के सात फ्रंटियर मॉडल चलाए। गिरावट का कारण कठिन डेटा है; एजेंट स्थिर होने पर, मॉडल कितना गिरे इसमें अंतर मॉडल के कारण है, एजेंट के नहीं।
  • हर मॉडल के लिए वही नियम। हर उत्तर को बेंचमार्क के आधिकारिक स्कोरर से स्कोर किया गया, प्रति मॉडल एक रन।

परिणाम

सटीकता, v1 से v2

आधिकारिक स्कोरर के अनुसार उत्तर सटीकता, v2 स्कोर के क्रम में।

मॉडलv1 (133 प्रश्न)v2 (90 प्रश्न)बदलाव
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • v1 पर, सात में से पाँच मॉडल 7 अंकों के दायरे में थे; v2 पर वही सात 31 अंकों में फैले हैं।
  • जो दो टिके रहे, Fable 5.1 और GPT-5.6 Sol, v1 पर बीच में थे और v2 पर पहले और दूसरे स्थान पर रहे।

v1: लागत और इन्फ़रेंस प्रोफ़ाइल

मॉडललागत / प्रश्नऔसत अवधिमॉडल कॉल / प्रश्नटूल कॉल / प्रश्नप्रति कॉल टूल
Fable 5.1$0.581.7 मिनट11.610.70.93
GPT-5.6 Sol$0.732.3 मिनट13.623.91.76
Opus 5$0.491.4 मिनट9.711.61.20
Fable 5$0.941.6 मिनट8.511.01.29
GPT-5.6 Terra$0.261.7 मिनट13.721.61.58
Gemini 3.1 Pro$0.301.3 मिनट17.816.20.91
Sonnet 5$0.282.2 मिनट12.314.01.14

v2: लागत और इन्फ़रेंस प्रोफ़ाइल

मॉडललागत / प्रश्नऔसत अवधिमॉडल कॉल / प्रश्नटूल कॉल / प्रश्नप्रति कॉल टूल
Fable 5.1$1.243.2 मिनट18.117.60.97
GPT-5.6 Sol$2.126.9 मिनट24.361.92.55
Opus 5$0.982.7 मिनट17.019.41.14
Fable 5$2.004.0 मिनट14.819.51.31
GPT-5.6 Terra$0.633.8 मिनट20.743.42.10
Gemini 3.1 Pro$1.015.3 मिनट38.436.90.96
Sonnet 5$0.837.0 मिनट25.933.01.27
  • हर मॉडल ने v2 पर अधिक मेहनत की: प्रति प्रश्न 2 से 3.4 गुना लागत, 1.5 से 2.6 गुना मॉडल और टूल कॉल, और 1.9 से 4.1 गुना समय।
  • जो दो टिके रहे, उन्होंने यह अलग-अलग तरीके से किया: Fable 5.1 ने सभी मॉडलों में सबसे कम टूल कॉल और प्रति प्रश्न 3.2 मिनट के साथ, GPT-5.6 Sol ने सबसे अधिक टूल कॉल और 6.9 मिनट के साथ।

निष्कर्ष

OfficeQA के दो संस्करण कुछ दुर्लभ पेश करते हैं: कठिनाई के दो स्तरों पर वही कार्य, ताकि आप देख सकें कि कार्य कठिन होने पर कौन से मॉडल प्रदर्शन बनाए रखते हैं और कौन से गिरते हैं। v1 पर सातों मॉडल एक साथ गुच्छे में थे; v2 पर वे दूर-दूर फैल गए। आसान डेटा मॉडलों के बीच के अंतर छिपाता है, कठिन डेटा उन्हें उजागर करता है।

Energent उपयोगकर्ताओं के लिए, यह चुनाव करते रहना हमारा काम है: जैसे-जैसे आपके कार्य कठिन होते हैं, हम आपके तरह के काम पर मॉडलों को मापते हैं, टिकने वाला मॉडल चुनते हैं, और सटीकता को गति और लागत के साथ संतुलित करते हैं, बिना आपके कुछ भी कॉन्फ़िगर किए।

आभार

OfficeQA के लिए Databricks टीम का विशेष आभार: एक कच्चा, उच्च-गुणवत्ता वाला और जान-बूझकर कठिन बनाया गया डेटासेट, जो वास्तविक दस्तावेज़ों पर सावधानीपूर्वक सत्यापित प्रश्नों के साथ बना है, और एक ही कार्य के दो संस्करणों में जारी किया गया है। यही निरंतरता है जिसने हमें यह रुझान देखने दिया। इन परिणामों पर एक विस्तृत पेपर तैयार किया जा रहा है।

संदर्भ

  1. Databricks, OfficeQA का परिचय, पहले संस्करण की घोषणा
  2. Databricks, OfficeQA Pro V2 का परिचय, दूसरे संस्करण की घोषणा
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. GitHub पर OfficeQA रिपॉज़िटरी
  5. Hugging Face पर OfficeQA Pro V2 डेटासेट

समाधान

हार्डवेयर

AI-सहायता प्राप्त CAD समीक्षाएँ और इंजीनियरिंग डिज़ाइन वर्कफ़्लो।