Vaikeampi data, sama agentti: kuinka paljon kukin malli putosi
Databricks teki OfficeQA:sta vaikeamman siirtyessään OfficeQA Pro -testistä OfficeQA Pro V2 -testiin: 2× suurempi korpus, 3.7× enemmän siteerattuja asiakirjoja kysymystä kohden, noin 9× enemmän luettavaa tekstiä. Energent piti malliriippumattoman agenttinsa muuttumattomana ja vertasi seitsemää huippumallia molemmilla painoksilla. Fable 5.1 ja GPT-5.6 Sol pysyivät 3 pisteen sisällä; muut viisi putosivat 6.5–28.8 pistettä, ja järjestys muuttui.
Lue artikkeli
