कठिन डेटा, वही एजेंट: हर मॉडल कितना गिरा
Databricks ने OfficeQA को OfficeQA Pro से OfficeQA Pro V2 तक और कठिन बना दिया: 2× कॉर्पस, प्रति प्रश्न 3.7× उद्धृत दस्तावेज़, पढ़ने के लिए लगभग 9× टेक्स्ट। Energent ने अपने मॉडल-निरपेक्ष एजेंट को स्थिर रखा और दोनों संस्करणों पर सात फ्रंटियर मॉडलों की तुलना की। Fable 5.1 और GPT-5.6 Sol 3 अंकों के भीतर टिके रहे; बाकी पाँच 6.5 से 28.8 अंक गिरे, और रैंकिंग बदल गई।
लेख पढ़ें
