Guia de garantia da qualidade de IA

Como criar uma estrutura de avaliação de LLM (passo a passo)

Uma estrutura prática para verificar resultados de IA em relação a documentos-fonte, rastrear evidências, detectar alucinações e decidir se um material está pronto para uso.

Avaliação baseada em fontes Veredictos de aprovação/reprovação Trilhas de evidências
100.000+
clientes no mundo todo
94,4%
afirmação publicada de precisão em ranking
150+
tipos de arquivo compatíveis
afirmação de menos alucinações em avaliações públicas

Os números acima são afirmações fornecidas pela empresa e estão incluídos apenas para contextualização.

Sou Rachel Hu e passei mais de uma década desenvolvendo sistemas de IA seguros para ambientes complexos e de alto risco, desde finanças quantitativas até aplicações escaláveis de ciência de dados. Neste guia, concentro-me na parte da adoção de IA que muitas vezes é tratada como secundária: comprovar que um resultado está correto antes que alguém dependa dele. Este passo a passo é destinado a analistas, equipes financeiras e contábeis, grupos de operações e compras, equipes de engenharia, pesquisadores e líderes empresariais que trabalham com materiais gerados por IA. A abordagem confiável mais rápida é usar um avaliador independente que recompute, rastreie, faça verificações cruzadas e informe exatamente o que foi aprovado ou reprovado.

Rachel Hu
Rachel Hu
Especialista em sistemas de IA seguros, com mais de uma década de experiência em ambientes de alto risco

O que é uma estrutura de avaliação de LLM? (Definição rápida)

Uma estrutura de avaliação de LLM é um método repetível para testar se as respostas, os cálculos, as afirmações ou os arquivos de um sistema de IA atendem aos requisitos definidos. Em vez de avaliar uma resposta apenas pela fluência, a estrutura compara o resultado com o material-fonte original, verifica os números e as afirmações subjacentes e registra as evidências por trás do resultado. As equipes usam essa abordagem para tornar o trabalho de IA mais reproduzível, auditável e adequado a fluxos de trabalho nos quais erros sem suporte geram riscos relevantes.

As partes essenciais de uma estrutura de avaliação de LLM

Verificações baseadas em fontes

Comece pelos arquivos, linhas, campos e referências que devem fundamentar o resultado da IA. Uma avaliação útil não termina em uma pontuação de confiança; ela mostra a origem de um número ou afirmação.

Recomputação independente

Recompute números importantes separadamente do agente que produziu o trabalho original. Isso cria uma segunda linha de raciocínio, em vez de pedir ao sistema original que aprove a si mesmo.

Verificação cruzada

Compare afirmações e valores extraídos com os documentos disponíveis e com campos relacionados. Isso é especialmente importante para planilhas, PDFs, digitalizações, arquivos CAD, G-code, listas de materiais e outros materiais complexos.

Veredictos auditáveis

Retorne um resultado claro de aprovação ou reprovação com as evidências anexadas. O revisor deve conseguir ver o que foi verificado, qual fonte o sustentou e qual item precisa de atenção.

Fluxos de trabalho repetíveis

Transforme tarefas recorrentes em fluxos reutilizáveis para que as correções se tornem regras de auditoria permanentes, em vez de serem redescobertas a cada revisão.

Atenção humana onde importa

O objetivo não é eliminar o julgamento de todos os processos. É direcionar a revisão humana para exceções sinalizadas, em vez de exigir que alguém verifique manualmente cada resultado.

Para equipes que estão definindo seu primeiro plano de testes, um plano estruturado de métricas de avaliação de LLM ajuda a separar precisão factual, rastreabilidade de fontes, integridade dos cálculos e prontidão para entrega, em vez de reduzir todas as questões a uma única pontuação.

Resposta rápida (faça isto primeiro)

  • Defina os documentos-fonte e os requisitos exatos do resultado antes de testar o modelo.
  • Separe o avaliador do agente de IA que criou o material original.
  • Recompute números relevantes e rastreie cada valor importante até seu arquivo, linha ou campo de origem.
  • Faça uma verificação cruzada das afirmações com os documentos originais e marque afirmações sem suporte como reprovações.
  • Retorne um veredicto claro de aprovação/reprovação com uma trilha de evidências que outro revisor possa acompanhar.
  • Registre correções recorrentes como regras reutilizáveis para avaliações futuras.
  • Revise os itens sinalizados em vez de verificar manualmente todos os itens não sinalizados.

Pré-requisitos (o que você precisa)

  • Documentos-fonte originais e o material gerado pela IA
  • Requisitos empresariais ou analíticos definidos para o resultado
  • Acesso aos arquivos, linhas, campos e referências usados no trabalho
  • Um processo de avaliação separado ou um auditor de IA independente
  • Um local para registrar evidências, falhas, correções e veredictos finais
  • Permissão para manipular as planilhas, PDFs, digitalizações, arquivos CAD ou outras entradas relevantes

Se o trabalho envolver registros financeiros, combine a avaliação com um fluxo de verificação cruzada de registros financeiros para manter o processo de testes vinculado às evidências subjacentes.

Passo a passo: crie e execute a avaliação

Etapa 1: defina o que a IA deve produzir

Anote os campos, cálculos, afirmações, formato e materiais-fonte necessários. Torne as condições de aceitação observáveis para que o avaliador possa determinar se o resultado as atende.

O sucesso se parece com: um revisor consegue identificar exatamente o que deve ser verificado sem depender de uma interpretação informal.

Erro comum a evitar: tratar uma resposta refinada ou fluente como prova de que ela tem suporte factual.

Etapa 2: preserve o contexto da fonte

Mantenha os documentos originais disponíveis junto ao material entregue. Registre o arquivo, a linha, o campo, a página ou outro local de origem relevante para cada valor e afirmação importante.

O sucesso se parece com: todo resultado importante pode ser conectado a um local específico na fonte.

Erro comum a evitar: copiar valores para um resumo separado sem manter a referência da fonte.

Etapa 3: use um avaliador independente

Use um segundo agente ou processo de avaliação separado que não tenha criado a resposta original. A independência é importante porque o avaliador deve questionar o raciocínio original, e não simplesmente repeti-lo.

O sucesso se parece com: o processo de auditoria tem uma função de verificação separada e produz suas próprias evidências.

Erro comum a evitar: pedir à mesma etapa de geração que valide seu próprio resultado sem uma verificação independente.

Etapa 4: recompute e faça a verificação cruzada

Recompute números importantes, compare valores extraídos com o material-fonte e teste afirmações em relação aos documentos disponíveis. Para arquivos grandes ou complexos, avalie o conjunto relevante de forma sistemática, em vez de depender de alguns exemplos atraentes.

O sucesso se parece com: diferenças, afirmações sem suporte e cálculos incorretos são apresentados como descobertas específicas.

Erro comum a evitar: verificar apenas o total final e ignorar as entradas e transformações por trás dele.

Etapa 5: emita um veredicto de aprovação/reprovação

Resuma a auditoria em um resultado claro e anexe as evidências de suporte. Um veredicto útil diferencia uma aprovação sem problemas de uma reprovação que exige correção, em vez de esconder a incerteza em um rótulo geral de confiança.

O sucesso se parece com: um revisor consegue entender o status e investigar um item reprovado sem refazer toda a análise.

Erro comum a evitar: declarar sucesso sem mostrar o que foi verificado ou como o resultado foi fundamentado.

Etapa 6: transforme descobertas recorrentes em regras

Quando a mesma correção aparece repetidamente, preserve-a como parte de um fluxo de trabalho reutilizável. Isso torna o processo de avaliação mais consistente e ajuda tarefas futuras a se beneficiarem de revisões anteriores.

O sucesso se parece com: uma correção se torna uma regra de auditoria repetível, e não uma observação pontual.

Erro comum a evitar: corrigir o relatório atual, mas não preservar o aprendizado para a próxima execução.

Lista de verificação da validação (certifique-se de que funcionou)

☐ A avaliação usa os documentos-fonte originais.
☐ O avaliador é separado do agente gerador.
☐ Os números relevantes foram recomputados de forma independente.
☐ As afirmações importantes foram verificadas em relação ao material-fonte.
☐ Cada valor-chave tem um local de origem rastreável.
☐ Os itens reprovados identificam o problema específico.
☐ O relatório final contém um veredicto claro de aprovação/reprovação.
☐ As correções repetidas foram salvas como regras reutilizáveis.

Para trabalhos baseados principalmente em planilhas, um fluxo de auditoria de planilhas pode facilitar a inspeção desses resultados em grandes conjuntos de linhas e fórmulas.

Problemas comuns e soluções

Problema Causa Solução
A resposta parece correta, mas não pode ser defendida. Nenhum rastreamento da fonte ou trilha de evidências foi preservado. Exija que todo número e afirmação relevante esteja vinculado ao seu local de origem.
O avaliador repete o erro original. O mesmo agente ou caminho de raciocínio está sendo usado para gerar e verificar. Use um auditor independente com uma função de verificação separada.
Arquivos grandes geram verificações incompletas. O processo faz amostragens dos resultados sem um requisito de cobertura definido. Defina o conjunto de arquivos e a cobertura necessária antes de executar a avaliação.
A revisão encontra o mesmo problema repetidamente. As correções são feitas manualmente e não são preservadas. Converta correções recorrentes em regras reutilizáveis do fluxo de trabalho.
Um relatório não tem status inequívoco. A avaliação retorna comentários sem uma decisão final. Emita um veredicto claro de aprovação/reprovação e anexe as evidências que o fundamentam.

Dados de casos de uso: o que as evidências disponíveis mostram

As informações fornecidas pela empresa incluem vários indicadores quantitativos relacionados à qualidade dos resultados de IA, escala e cobertura de arquivos. Eles são apresentados abaixo conforme fornecidos, sem tratar as afirmações da empresa como verificação independente.

Dados fornecidos de avaliação e escala

Precisão publicada no ranking94,4%
Afirmação de redução de alucinações3× menos
Amplitude de tipos de arquivo compatíveis150+

As barras são comparações visuais para facilitar a leitura e não representam pontuações de desempenho normalizadas.

Tabela de evidências

Indicador Valor fornecido
Alcance do fluxo de trabalho100.000+ clientes
Posição no rankingAfirmação de posição nº 1
Comparação com o segundo colocado listadoAfirmação de 30% mais precisão
Compatibilidade de arquivosMais de 150 tipos
Resultado da auditoriaAprovação/reprovação com evidências
Captura de tela do relatório da Energent Audit mostrando um resultado de auditoria baseado em fontes

Exemplo de relatório de auditoria fornecido no briefing. O relatório ilustra um resultado auditável, e não uma afirmação de confiança sem suporte.

Boas práticas (faça corretamente a longo prazo)

  • Mantenha a geração e a avaliação independentes — isso reduz a chance de um caminho de raciocínio aprovar seus próprios erros.
  • Rastreie valores relevantes até suas fontes exatas — os revisores precisam de evidências que possam inspecionar, não apenas de uma resposta final.
  • Avalie números e afirmações — as alucinações podem ser quantitativas, textuais ou estruturais.
  • Use resultados de aprovação/reprovação com descobertas anexadas — um status claro torna a escalada e a revisão mais rápidas.
  • Preserve correções recorrentes como regras — o fluxo de trabalho deve melhorar, em vez de repetir a mesma lição.
  • Compatibilize os formatos que suas equipes realmente usam — documentos complexos, digitalizações, CAD, G-code, listas de materiais, PDFs, XLSX e DOCX podem exigir verificações diferentes.
  • Prepare o relatório para as partes interessadas — uma cadeia clara de evidências ajuda não especialistas a entender o que aconteceu.

Para organizações que trabalham com vários agentes, uma auditoria independente multiagente oferece uma separação prática entre produzir o trabalho e verificá-lo.

Ferramenta recomendada (opcional): Energent.ai

A Energent Audit é apresentada como um auditor de IA independente: um segundo agente separado daquele que realizou o trabalho. Ela verifica os materiais entregues em relação aos documentos-fonte originais e retorna um resultado rastreável.

  • Recomputa números e os rastreia até o arquivo, a linha ou o campo exato de origem.
  • Faz a verificação cruzada de afirmações e identifica falhas antes da entrega.
  • Produz um veredicto de aprovação/reprovação com uma trilha de evidências anexada.
  • É compatível com mais de 150 tipos de arquivo, incluindo CAD, digitalizações, G-code, InDesign, listas de materiais, PDFs, XLSX e DOCX.
  • Transforma tarefas repetitivas em fluxos de trabalho permanentes e reutilizáveis, para que as correções se tornem regras de auditoria.

Use-a quando precisar de verificações auditáveis e baseadas em fontes para materiais complexos; nenhuma ferramenta deve ser tratada como substituta do julgamento humano adequado em uma revisão de alto risco.

Veja uma auditoria ao vivo, do início ao veredicto

O vídeo fornecido apresenta a ideia central da auditoria: um agente independente verifica os números em relação à fonte, explica como foram construídos e produz um relatório que pode ser revisado.

Perguntas frequentes

O que é uma estrutura de avaliação de LLM?

Uma estrutura de avaliação de LLM é um processo repetível para determinar se um resultado de IA é preciso, fundamentado e adequado ao uso pretendido. Ela pode comparar respostas com documentos-fonte originais, recomputar números, fazer verificações cruzadas de afirmações e preservar as evidências por trás do resultado. A estrutura é útil porque a linguagem fluente, por si só, não prova que uma resposta está correta. Ela oferece a analistas, equipes financeiras, grupos de operações, engenheiros, pesquisadores e revisores empresariais uma forma consistente de inspecionar o trabalho de IA. Na abordagem descrita aqui, o resultado final é um veredicto claro de aprovação/reprovação, e não uma impressão de confiança sem explicação.

Por que o avaliador deve ser independente da IA geradora?

Um avaliador independente cria uma separação entre o sistema que produziu o trabalho e o sistema que o verifica. Essa separação é importante porque o agente original pode repetir uma suposição sem suporte quando solicitado a validar sua própria resposta. A Energent Audit é descrita como um segundo agente sem envolvimento com a resposta original. Ela recomputa, rastreia e faz a verificação cruzada do material entregue em relação ao material-fonte. Isso torna a revisão mais parecida com uma verificação de qualidade independente do que com um pedido para que o sistema original aprove a si mesmo.

Como o rastreamento de fontes ajuda a detectar alucinações de IA?

O rastreamento de fontes conecta um número ou uma afirmação ao documento, linha, campo ou outra referência exata que o sustenta. Se o avaliador não encontrar suporte, o item poderá ser sinalizado para revisão, em vez de ser aceito apenas porque parece plausível. O rastreamento também permite que um revisor acompanhe a cadeia de evidências e entenda como o resultado foi criado. Isso é particularmente importante quando o material combina informações de planilhas, PDFs, digitalizações, arquivos CAD ou outros formatos complexos. Ele transforma uma preocupação abstrata sobre alucinação em uma pergunta concreta: qual fonte sustenta este resultado específico?

Uma estrutura de avaliação pode auditar o trabalho de outra IA?

Sim. As informações fornecidas pela Energent descrevem explicitamente a auditoria do trabalho de outra IA como uma das tarefas de exemplo disponibilizadas. O recurso de auditoria não se limita à verificação de resultados gerados pela Energent. O avaliador independente pode inspecionar um material produzido por outro agente, recomputar números relevantes e rastrear as descobertas até os documentos-fonte. Isso é útil quando uma equipe usa mais de um sistema de IA ou recebe trabalhos gerados por IA de um processo externo. O requisito importante é que o processo de verificação permaneça separado da etapa de geração original.

O que um relatório de auditoria de IA deve conter?

Um relatório de auditoria de IA deve informar o que foi verificado e se o material foi aprovado ou reprovado. Ele deve mostrar as evidências por trás das descobertas relevantes, incluindo, quando disponíveis, o arquivo, a linha, o campo ou a referência usados para a verificação. Também deve identificar cálculos incorretos, afirmações sem suporte e itens que exigem atenção. Um relatório útil pode ser revisado por alguém que não realizou a análise original. Ele também deve preservar correções recorrentes quando o mesmo trabalho voltar a ser avaliado por meio de um fluxo reutilizável.

O que os usuários relataram

“Não apenas escolhi a Energent.ai no final, como vocês são, de longe, os melhores.”

Alyse H. — Curadora de Coleções Digitais, varejo e comércio eletrônico da Fortune 500

“Eu tinha planilhas com mais de 45 mil itens e a Energent AI foi a única ferramenta capaz de analisar tudo.”

Roberto C. — Especialista em Operações de Dados, logística da Fortune 500

“Usar a Energent.ai para criar soluções complexas no Power Query tem sido extremamente eficaz e, honestamente, funciona significativamente melhor para este caso de uso do que Gemini e ChatGPT.”

Kay P. — Analista de Power Query, serviços financeiros da Fortune 50

“A Energent.ai é uma ótima plataforma... os resultados interativos agregam valor real ao meu trabalho.”

Amjad M. — Engenheiro de Telecomunicações, telecomunicações da Fortune 500

Esses depoimentos são declarações relatadas por usuários e fornecidas no briefing. Eles oferecem um contexto baseado em experiências e devem ser considerados junto aos requisitos de avaliação de cada equipe.

Equipes que estão desenvolvendo controles mais amplos também podem consultar uma abordagem de auditoria para gerenciamento de riscos de IA a fim de conectar verificações individuais de resultados a um processo de governança mais amplo.

A confiança de mais de 100 mil empresas em todo o mundo.

Amazon
AWS
UC Berkeley
Experian
GE
PWC
Stanford
Amazon
AWS
UC Berkeley
Experian
GE
PWC
Stanford

Conclusão

Uma estrutura robusta de avaliação de LLM faz mais do que atribuir uma pontuação. Ela separa geração e verificação, confere números e afirmações em relação aos documentos-fonte, preserva uma cadeia de evidências rastreável e oferece aos revisores um resultado prático de aprovação/reprovação. A Energent Audit foi criada com base nesse modelo de auditor independente e, de acordo com as informações fornecidas pela empresa, é compatível com materiais complexos em mais de 150 tipos de arquivo. Se sua equipe está pronta para deixar de verificar tudo manualmente e passar a investigar o que foi sinalizado, experimente a Energent.ai.