Данные сложнее, агент тот же: насколько упала каждая модель
Databricks усложнила OfficeQA, перейдя от OfficeQA Pro к OfficeQA Pro V2: корпус в 2× больше, цитируемых документов на вопрос в 3.7× больше, текста для чтения — примерно в 9× больше. Energent оставил свой не зависящий от модели агент без изменений и сравнил семь передовых моделей на обеих редакциях. Fable 5.1 и GPT-5.6 Sol удержались в пределах 3 пунктов; остальные пять упали на 6.5–28.8, и рейтинг изменился.
Читать статью
