Destaques
AnúnciosBenchmark

Dados mais difíceis, mesmo agente: quanto caiu cada modelo

Dados OfficeQA da Databricks mais difíceis, o mesmo agente Energent, sete modelos de fronteira: o Fable 5.1 e o GPT-5.6 Sol mantiveram-se dentro de uma margem de 3 pontos, os outros cinco caíram entre 6 e 29.

Equipa Energent
Gráfico de setas de queda de sete modelos do OfficeQA v1 ao v2: o Fable 5.1 e o GPT-5.6 Sol mantiveram-se, cinco outros caíram
Abrir o gráfico em resolução total

A Databricks tornou o OfficeQA mais difícil com uma segunda edição. Mantivemos o agente Energent fixo e comparámos os mesmos modelos em ambas as edições. As setas no gráfico acima mostram o que cada modelo perdeu entre edições.

Resumo

  • Dois modelos mantiveram-se: Fable 5.1 (72.2% → 70.0%) e GPT-5.6 Sol (71.4% → 68.9%). Cinco caíram entre 6.5 e 28.8 pontos.
  • A classificação reorganizou-se. O Opus 5 liderou a v1 com 74.4% e caiu para terceiro; o Sonnet 5 passou de 67.7% para 38.9%, de quinto para último.
  • "Mais difícil" é mensurável: 2× o corpus (697 → 1,435 documentos), 3.7× os documentos citados por pergunta (1.8 → 6.7) e cerca de 9× o texto a ler por pergunta (≈1 MB → ≈9 MB).
  • Para os utilizadores da Energent, nada a configurar: o agente é agnóstico ao modelo, por isso, à medida que as suas tarefas crescem, medimos, escolhemos o modelo que se mantém e garantimos-lhe o melhor desempenho e velocidade.

Contexto: OfficeQA, da v1 à v2

O OfficeQA é o benchmark da Databricks para raciocínio fundamentado sobre relatórios financeiros do Tesouro dos EUA. A v1 aqui é o OfficeQA Pro, apresentado no primeiro anúncio: as 133 perguntas classificadas como difíceis no benchmark original, sobre 697 Treasury Bulletins, escritas à mão por anotadores humanos.

A v2 é o OfficeQA Pro V2, apresentado no segundo anúncio: 90 perguntas sobre 1,435 livros de registo digitalizados de receitas e despesas federais de 1793 a 2024.

Lado a lado, a v2 é mais difícil em todos os eixos que importam para um agente:

v1v2Variação
Documentos no corpus6971,435
Documentos citados por pergunta (média)1.86.73.7×
Texto a ler por pergunta (média)≈1 MB≈9 MB≈9×

Poucos benchmarks recebem uma segunda edição da mesma tarefa. O OfficeQA recebeu, o que faz da dificuldade um eixo ao longo do qual se pode medir.

Como testámos

  • Porquê o OfficeQA. Assemelha-se ao trabalho que os nossos utilizadores trazem para a Energent: encontrar os documentos certos, extrair valores de tabelas densas, combiná-los e devolver uma resposta exata que possa ser verificada.
  • O mesmo agente, só o modelo trocado. O agente Energent é agnóstico ao modelo. As mesmas ferramentas, prompts e orçamento de passos executaram sete modelos de fronteira da Anthropic, OpenAI e Google em ambas as edições. Os dados mais difíceis são o que provoca a queda; com o agente fixo, as diferenças entre modelos na dimensão da queda devem-se ao modelo, não ao agente.
  • As mesmas regras para todos os modelos. Cada resposta é pontuada pelo avaliador oficial do benchmark, uma execução por modelo.

Resultados

Precisão, da v1 à v2

Precisão das respostas segundo o avaliador oficial, ordenada pela pontuação na v2.

Modelov1 (133 perg.)v2 (90 perg.)Variação
Fable 5.172.2%70.0%−2.2
GPT-5.6 Sol71.4%68.9%−2.5
Opus 574.4%63.3%−11.1
Fable 572.2%57.8%−14.4
GPT-5.6 Terra60.9%54.4%−6.5
Gemini 3.1 Pro56.4%44.4%−12.0
Sonnet 567.7%38.9%−28.8
  • Na v1, cinco dos sete modelos situavam-se numa faixa de 7 pontos; na v2, os mesmos sete abrangem 31 pontos.
  • Os dois que se mantiveram, Fable 5.1 e GPT-5.6 Sol, estavam a meio da tabela na v1 e terminam em primeiro e segundo na v2.

v1: custo e perfil de inferência

ModeloCusto / perguntaDuração médiaChamadas ao modelo / perg.Chamadas a ferramentas / perg.Ferramentas por chamada
Fable 5.1$0.581.7 min11.610.70.93
GPT-5.6 Sol$0.732.3 min13.623.91.76
Opus 5$0.491.4 min9.711.61.20
Fable 5$0.941.6 min8.511.01.29
GPT-5.6 Terra$0.261.7 min13.721.61.58
Gemini 3.1 Pro$0.301.3 min17.816.20.91
Sonnet 5$0.282.2 min12.314.01.14

v2: custo e perfil de inferência

ModeloCusto / perguntaDuração médiaChamadas ao modelo / perg.Chamadas a ferramentas / perg.Ferramentas por chamada
Fable 5.1$1.243.2 min18.117.60.97
GPT-5.6 Sol$2.126.9 min24.361.92.55
Opus 5$0.982.7 min17.019.41.14
Fable 5$2.004.0 min14.819.51.31
GPT-5.6 Terra$0.633.8 min20.743.42.10
Gemini 3.1 Pro$1.015.3 min38.436.90.96
Sonnet 5$0.837.0 min25.933.01.27
  • Todos os modelos trabalharam mais na v2: 2 a 3.4 vezes o custo por pergunta, 1.5 a 2.6 vezes as chamadas ao modelo e a ferramentas, e 1.9 a 4.1 vezes mais tempo.
  • Os dois que se mantiveram fizeram-no de forma diferente: o Fable 5.1 com o menor número de chamadas a ferramentas de todos os modelos e 3.2 minutos por pergunta, o GPT-5.6 Sol com o maior número de chamadas a ferramentas e 6.9 minutos.

Conclusão

As duas edições do OfficeQA oferecem algo raro: a mesma tarefa em dois níveis de dificuldade, para que se possa ver que modelos continuam a ter bom desempenho à medida que a tarefa se torna mais difícil e quais caem. Na v1, os sete modelos estavam agrupados; na v2, dispersaram-se amplamente. Dados fáceis escondem as diferenças entre modelos, dados difíceis expõem-nas.

Para os utilizadores da Energent, essa escolha continua a ser nossa: à medida que as suas tarefas se tornam mais difíceis, medimos os modelos no seu tipo de trabalho, escolhemos o que se mantém e equilibramos a precisão com a velocidade e o custo, sem nada para configurar.

Agradecimentos

Um agradecimento especial à equipa da Databricks pelo OfficeQA: um conjunto de dados em bruto, de alta qualidade e deliberadamente mais difícil, construído sobre documentos reais com perguntas cuidadosamente verificadas, e lançado em duas edições da mesma tarefa. Foi essa continuidade que nos permitiu ver esta tendência. Um artigo detalhado sobre estes resultados está em preparação.

Referências

  1. Databricks, Apresentamos o OfficeQA, o anúncio da primeira edição
  2. Databricks, Apresentamos o OfficeQA Pro V2, o anúncio da segunda edição
  3. OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
  4. Repositório do OfficeQA no GitHub
  5. Conjunto de dados OfficeQA Pro V2 no Hugging Face

Soluções

Hardware

Revisões de CAD assistidas por IA e fluxos de trabalho de design de engenharia.