Nehezebb adatok, ugyanaz az ügynök: mennyit esett vissza egy-egy modell
A Databricks nehezebbé tette az OfficeQA-t, az OfficeQA Pro kiadástól az OfficeQA Pro V2 kiadásig: 2× akkora korpusz, 3.7× annyi hivatkozott dokumentum kérdésenként, nagyjából 9× annyi elolvasandó szöveg. Az Energent változatlanul hagyta modellfüggetlen ügynökét, és hét élvonalbeli modellt hasonlított össze mindkét kiadáson. A Fable 5.1 és a GPT-5.6 Sol 3 ponton belül tartotta magát; a másik öt 6.5 és 28.8 pont között esett vissza, és a rangsor megváltozott.
Cikk elolvasása
