Daha zor veri, aynı ajan: her model ne kadar geriledi
Databricks, OfficeQA Pro’dan OfficeQA Pro V2’ye geçerek OfficeQA’yı daha da zorlaştırdı: derlem 2×, soru başına atıf yapılan belge 3.7×, okunacak metin yaklaşık 9×. Energent, modelden bağımsız ajanını sabit tuttu ve yedi öncü modeli her iki sürümde karşılaştırdı. Fable 5.1 ve GPT-5.6 Sol 3 puan içinde kaldı; diğer beşi 6.5 ile 28.8 puan arasında geriledi ve sıralama değişti.
Makaleyi oku
