جعلت Databricks اختبار OfficeQA أصعب بإصدار ثانٍ. أبقينا وكيل Energent ثابتًا وقارنّا النماذج نفسها على الإصدارين. تُظهر الأسهم في الرسم البياني أعلاه ما خسره كل نموذج بين الإصدارين.
الخلاصة
- حافظ نموذجان على مستواهما: Fable 5.1 (72.2% → 70.0%) وGPT-5.6 Sol (71.4% → 68.9%). وتراجعت خمسة نماذج بمقدار 6.5 إلى 28.8 نقطة.
- أعيد ترتيب التصنيف. تصدّر Opus 5 الإصدار v1 بنسبة 74.4% ثم تراجع إلى المركز الثالث؛ وهبط Sonnet 5 من 67.7% إلى 38.9%، من المركز الخامس إلى الأخير.
- «الأصعب» قابل للقياس: حجم المجموعة 2× (697 → 1,435 وثيقة)، والوثائق المُستشهد بها لكل سؤال 3.7× (1.8 → 6.7)، والنص المطلوب قراءته لكل سؤال نحو 9× (≈1 MB → ≈9 MB).
- لا شيء يحتاج مستخدمو Energent إلى ضبطه: فالوكيل محايد تجاه النموذج، ولذلك كلما كبرت مهامكم نقيس، ونختار النموذج الذي يصمد، ونحافظ لكم على أفضل أداء وسرعة.
الخلفية: OfficeQA من v1 إلى v2
OfficeQA هو الاختبار المعياري من Databricks للاستدلال المستند إلى الوثائق على التقارير المالية لوزارة الخزانة الأمريكية. v1 هنا هو OfficeQA Pro، الذي قُدّم في الإعلان الأول: الأسئلة الـ133 المصنفة صعبة في الاختبار المعياري الأصلي، على 697 نشرة من نشرات وزارة الخزانة، كتبها مُعلّقون بشريون يدويًا.
أما v2 فهو OfficeQA Pro V2، الذي قُدّم في الإعلان الثاني: 90 سؤالًا على 1,435 سجلًا ممسوحًا ضوئيًا للإيرادات والنفقات الفيدرالية من 1793 إلى 2024.
عند المقارنة جنبًا إلى جنب، يكون v2 أصعب على كل محور يهم الوكيل:
| v1 | v2 | التغيّر | |
|---|---|---|---|
| الوثائق في المجموعة | 697 | 1,435 | 2× |
| الوثائق المُستشهد بها لكل سؤال (المتوسط) | 1.8 | 6.7 | 3.7× |
| النص المطلوب قراءته لكل سؤال (المتوسط) | ≈1 MB | ≈9 MB | ≈9× |
قليلة هي الاختبارات المعيارية التي تحصل على إصدار ثانٍ للمهمة نفسها. وقد حصل OfficeQA على ذلك، ما يجعل الصعوبة محورًا يمكن القياس على امتداده.
كيف اختبرنا
- لماذا OfficeQA. لأنه يشبه العمل الذي يجلبه مستخدمونا إلى Energent: العثور على الوثائق الصحيحة، واستخراج الأرقام من جداول كثيفة، ودمجها، وإرجاع إجابة دقيقة يمكن التحقق منها.
- الوكيل نفسه، ولم يتبدل سوى النموذج. وكيل Energent محايد تجاه النموذج. الأدوات نفسها والموجّهات نفسها وميزانية الخطوات نفسها شغّلت سبعة نماذج رائدة من Anthropic وOpenAI وGoogle على الإصدارين. البيانات الأصعب هي ما يدفع التراجع؛ ومع تثبيت الوكيل، تعود الفروق بين النماذج في مقدار تراجعها إلى النموذج لا إلى الوكيل.
- القواعد نفسها لكل نموذج. تُقيَّم كل إجابة بأداة التقييم الرسمية للاختبار المعياري، بتشغيل واحد لكل نموذج.
النتائج
الدقة من v1 إلى v2
دقة الإجابات وفق أداة التقييم الرسمية، مرتبة حسب نتيجة v2.
| النموذج | v1 (133 سؤالًا) | v2 (90 سؤالًا) | التغيّر |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- في v1، وقعت خمسة من النماذج السبعة ضمن نطاق 7 نقاط؛ وفي v2 يمتد النطاق بين النماذج السبعة نفسها إلى 31 نقطة.
- النموذجان اللذان صمدا، Fable 5.1 وGPT-5.6 Sol، كانا في منتصف الترتيب في v1 وحلّا في المركزين الأول والثاني في v2.
v1: التكلفة وملف الاستدلال
| النموذج | التكلفة / سؤال | متوسط المدة | استدعاءات النموذج / سؤال | استدعاءات الأدوات / سؤال | الأدوات لكل استدعاء |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: التكلفة وملف الاستدلال
| النموذج | التكلفة / سؤال | متوسط المدة | استدعاءات النموذج / سؤال | استدعاءات الأدوات / سؤال | الأدوات لكل استدعاء |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- بذل كل نموذج جهدًا أكبر في v2: من 2 إلى 3.4 أضعاف التكلفة لكل سؤال، ومن 1.5 إلى 2.6 أضعاف استدعاءات النموذج والأدوات، ومن 1.9 إلى 4.1 أضعاف المدة.
- النموذجان اللذان صمدا فعلا ذلك بطريقتين مختلفتين: Fable 5.1 بأقل عدد من استدعاءات الأدوات بين جميع النماذج و3.2 دقيقة لكل سؤال، وGPT-5.6 Sol بأكبر عدد من استدعاءات الأدوات و6.9 دقيقة.
الخاتمة
يقدم إصدارا OfficeQA شيئًا نادرًا: المهمة نفسها بمستويين من الصعوبة، بحيث يمكنك أن ترى أي النماذج تواصل الأداء مع ازدياد صعوبة المهمة وأيها يتراجع. في v1 كانت النماذج السبعة متقاربة؛ وفي v2 تباعدت كثيرًا. البيانات السهلة تخفي الفروق بين النماذج، والبيانات الصعبة تكشفها.
بالنسبة إلى مستخدمي Energent، يبقى هذا الاختيار مسؤوليتنا نحن: فكلما ازدادت مهامكم صعوبة، نقيس النماذج على نوع عملكم، ونختار النموذج الذي يصمد، ونوازن بين الدقة والسرعة والتكلفة، دون أن تحتاجوا إلى ضبط أي شيء.
شكر وتقدير
شكر خاص لفريق Databricks على OfficeQA: مجموعة بيانات خام وعالية الجودة وأصعب عن قصد، مبنية على وثائق حقيقية بأسئلة مُتحقق منها بعناية، وصادرة في إصدارين للمهمة نفسها. هذه الاستمرارية هي ما أتاح لنا رؤية هذا الاتجاه أصلًا. وثمة ورقة بحثية مفصلة عن هذه النتائج قيد الإعداد.
المراجع
- Databricks، تقديم OfficeQA، إعلان الإصدار الأول
- Databricks، تقديم OfficeQA Pro V2، إعلان الإصدار الثاني
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning، arXiv 2603.08655
- مستودع OfficeQA على GitHub
- مجموعة بيانات OfficeQA Pro V2 على Hugging Face
