より難しいデータ、同じエージェント:各モデルはどれだけ落ちたか
DatabricksはOfficeQAをOfficeQA ProからOfficeQA Pro V2へとより難しくしました:コーパスは2×、質問あたりの引用文書数は3.7×、読むべきテキスト量は約9×です。Energentはモデル非依存のエージェントを固定したまま、7つのフロンティアモデルを両方の版で比較しました。Fable 5.1とGPT-5.6 Solは3ポイント以内を維持し、他の5つは6.5〜28.8ポイント落ち、順位が変わりました。
記事を読む
