A Databricks tornou o OfficeQA mais difícil com uma segunda edição. Mantivemos o agente Energent fixo e comparámos os mesmos modelos em ambas as edições. As setas no gráfico acima mostram o que cada modelo perdeu entre edições.
Resumo
- Dois modelos mantiveram-se: Fable 5.1 (72.2% → 70.0%) e GPT-5.6 Sol (71.4% → 68.9%). Cinco caíram entre 6.5 e 28.8 pontos.
- A classificação reorganizou-se. O Opus 5 liderou a v1 com 74.4% e caiu para terceiro; o Sonnet 5 passou de 67.7% para 38.9%, de quinto para último.
- "Mais difícil" é mensurável: 2× o corpus (697 → 1,435 documentos), 3.7× os documentos citados por pergunta (1.8 → 6.7) e cerca de 9× o texto a ler por pergunta (≈1 MB → ≈9 MB).
- Para os utilizadores da Energent, nada a configurar: o agente é agnóstico ao modelo, por isso, à medida que as suas tarefas crescem, medimos, escolhemos o modelo que se mantém e garantimos-lhe o melhor desempenho e velocidade.
Contexto: OfficeQA, da v1 à v2
O OfficeQA é o benchmark da Databricks para raciocínio fundamentado sobre relatórios financeiros do Tesouro dos EUA. A v1 aqui é o OfficeQA Pro, apresentado no primeiro anúncio: as 133 perguntas classificadas como difíceis no benchmark original, sobre 697 Treasury Bulletins, escritas à mão por anotadores humanos.
A v2 é o OfficeQA Pro V2, apresentado no segundo anúncio: 90 perguntas sobre 1,435 livros de registo digitalizados de receitas e despesas federais de 1793 a 2024.
Lado a lado, a v2 é mais difícil em todos os eixos que importam para um agente:
| v1 | v2 | Variação | |
|---|---|---|---|
| Documentos no corpus | 697 | 1,435 | 2× |
| Documentos citados por pergunta (média) | 1.8 | 6.7 | 3.7× |
| Texto a ler por pergunta (média) | ≈1 MB | ≈9 MB | ≈9× |
Poucos benchmarks recebem uma segunda edição da mesma tarefa. O OfficeQA recebeu, o que faz da dificuldade um eixo ao longo do qual se pode medir.
Como testámos
- Porquê o OfficeQA. Assemelha-se ao trabalho que os nossos utilizadores trazem para a Energent: encontrar os documentos certos, extrair valores de tabelas densas, combiná-los e devolver uma resposta exata que possa ser verificada.
- O mesmo agente, só o modelo trocado. O agente Energent é agnóstico ao modelo. As mesmas ferramentas, prompts e orçamento de passos executaram sete modelos de fronteira da Anthropic, OpenAI e Google em ambas as edições. Os dados mais difíceis são o que provoca a queda; com o agente fixo, as diferenças entre modelos na dimensão da queda devem-se ao modelo, não ao agente.
- As mesmas regras para todos os modelos. Cada resposta é pontuada pelo avaliador oficial do benchmark, uma execução por modelo.
Resultados
Precisão, da v1 à v2
Precisão das respostas segundo o avaliador oficial, ordenada pela pontuação na v2.
| Modelo | v1 (133 perg.) | v2 (90 perg.) | Variação |
|---|---|---|---|
| Fable 5.1 | 72.2% | 70.0% | −2.2 |
| GPT-5.6 Sol | 71.4% | 68.9% | −2.5 |
| Opus 5 | 74.4% | 63.3% | −11.1 |
| Fable 5 | 72.2% | 57.8% | −14.4 |
| GPT-5.6 Terra | 60.9% | 54.4% | −6.5 |
| Gemini 3.1 Pro | 56.4% | 44.4% | −12.0 |
| Sonnet 5 | 67.7% | 38.9% | −28.8 |
- Na v1, cinco dos sete modelos situavam-se numa faixa de 7 pontos; na v2, os mesmos sete abrangem 31 pontos.
- Os dois que se mantiveram, Fable 5.1 e GPT-5.6 Sol, estavam a meio da tabela na v1 e terminam em primeiro e segundo na v2.
v1: custo e perfil de inferência
| Modelo | Custo / pergunta | Duração média | Chamadas ao modelo / perg. | Chamadas a ferramentas / perg. | Ferramentas por chamada |
|---|---|---|---|---|---|
| Fable 5.1 | $0.58 | 1.7 min | 11.6 | 10.7 | 0.93 |
| GPT-5.6 Sol | $0.73 | 2.3 min | 13.6 | 23.9 | 1.76 |
| Opus 5 | $0.49 | 1.4 min | 9.7 | 11.6 | 1.20 |
| Fable 5 | $0.94 | 1.6 min | 8.5 | 11.0 | 1.29 |
| GPT-5.6 Terra | $0.26 | 1.7 min | 13.7 | 21.6 | 1.58 |
| Gemini 3.1 Pro | $0.30 | 1.3 min | 17.8 | 16.2 | 0.91 |
| Sonnet 5 | $0.28 | 2.2 min | 12.3 | 14.0 | 1.14 |
v2: custo e perfil de inferência
| Modelo | Custo / pergunta | Duração média | Chamadas ao modelo / perg. | Chamadas a ferramentas / perg. | Ferramentas por chamada |
|---|---|---|---|---|---|
| Fable 5.1 | $1.24 | 3.2 min | 18.1 | 17.6 | 0.97 |
| GPT-5.6 Sol | $2.12 | 6.9 min | 24.3 | 61.9 | 2.55 |
| Opus 5 | $0.98 | 2.7 min | 17.0 | 19.4 | 1.14 |
| Fable 5 | $2.00 | 4.0 min | 14.8 | 19.5 | 1.31 |
| GPT-5.6 Terra | $0.63 | 3.8 min | 20.7 | 43.4 | 2.10 |
| Gemini 3.1 Pro | $1.01 | 5.3 min | 38.4 | 36.9 | 0.96 |
| Sonnet 5 | $0.83 | 7.0 min | 25.9 | 33.0 | 1.27 |
- Todos os modelos trabalharam mais na v2: 2 a 3.4 vezes o custo por pergunta, 1.5 a 2.6 vezes as chamadas ao modelo e a ferramentas, e 1.9 a 4.1 vezes mais tempo.
- Os dois que se mantiveram fizeram-no de forma diferente: o Fable 5.1 com o menor número de chamadas a ferramentas de todos os modelos e 3.2 minutos por pergunta, o GPT-5.6 Sol com o maior número de chamadas a ferramentas e 6.9 minutos.
Conclusão
As duas edições do OfficeQA oferecem algo raro: a mesma tarefa em dois níveis de dificuldade, para que se possa ver que modelos continuam a ter bom desempenho à medida que a tarefa se torna mais difícil e quais caem. Na v1, os sete modelos estavam agrupados; na v2, dispersaram-se amplamente. Dados fáceis escondem as diferenças entre modelos, dados difíceis expõem-nas.
Para os utilizadores da Energent, essa escolha continua a ser nossa: à medida que as suas tarefas se tornam mais difíceis, medimos os modelos no seu tipo de trabalho, escolhemos o que se mantém e equilibramos a precisão com a velocidade e o custo, sem nada para configurar.
Agradecimentos
Um agradecimento especial à equipa da Databricks pelo OfficeQA: um conjunto de dados em bruto, de alta qualidade e deliberadamente mais difícil, construído sobre documentos reais com perguntas cuidadosamente verificadas, e lançado em duas edições da mesma tarefa. Foi essa continuidade que nos permitiu ver esta tendência. Um artigo detalhado sobre estes resultados está em preparação.
Referências
- Databricks, Apresentamos o OfficeQA, o anúncio da primeira edição
- Databricks, Apresentamos o OfficeQA Pro V2, o anúncio da segunda edição
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning, arXiv 2603.08655
- Repositório do OfficeQA no GitHub
- Conjunto de dados OfficeQA Pro V2 no Hugging Face
