더 어려운 데이터, 같은 에이전트: 각 모델은 얼마나 떨어졌나
Databricks는 OfficeQA Pro에서 OfficeQA Pro V2로 OfficeQA를 더 어렵게 만들었습니다: 코퍼스는 2×, 질문당 인용 문서 수는 3.7×, 읽어야 할 텍스트는 약 9×입니다. Energent는 모델 독립적 에이전트를 고정한 채 7개 프론티어 모델을 두 에디션에서 비교했습니다. Fable 5.1과 GPT-5.6 Sol은 3점 이내로 유지했고, 나머지 5개는 6.5~28.8점 떨어졌으며 순위가 바뀌었습니다.
기사 읽기
