Ter o agente funcionando é apenas o primeiro passo.Autor do artigo: elune
Artigo compilado, fonte: ME News
Ter o agente funcionando é apenas o primeiro passo.
O verdadeiramente difícil é determinar: se ele é estável, se está correto, ou se degradou silenciosamente devido a uma única instrução ou atualização do modelo.
Os 10 métodos de avaliação a seguir são essenciais para todos os engenheiros de IA.
1. Golden Set
Prepare a set of fixed and frozen test cases.
Após cada modificação nos prompts, modelos, ferramentas ou fluxos de trabalho, execute novamente este conjunto de casos para determinar se o sistema melhorou ou se falhou silenciosamente em alguns cenários.
É a linha de base mais básica no sistema de avaliação do Agente.
Ferramenta recomendada: OpenAI Evals
Pode ser usado para construir um conjunto de benchmarks executáveis repetidamente e comparar o desempenho de diferentes modelos ou versões do sistema.
2. Juiz LLM | LLM como Juiz
Use another large language model to evaluate open-ended responses based on pre-written scoring criteria.
Este método é especialmente eficaz quando a tarefa não tem uma resposta única padrão e não pode ser julgada como correta ou incorreta por correspondência de string ou saída fixa.
Por exemplo, o modelo de julgamento pode avaliar se a resposta é precisa, completa, relevante e se segue as exigências do usuário.
Ferramenta recomendada: OpenEvals
Forneça avaliadores prontos para aplicações de LLM para criar rapidamente fluxos de revisão automatizados.
3. Avaliação Multidimensional | Rubric Scoring
Não dê ao agente apenas uma “pontuação de qualidade” geral.
Deve ser avaliado separadamente:
- Correção
- Integridade
- Estilo de expressão
- Segurança
- Tempo de resposta
- Custo de chamada
Uma pontuação composta pode ocultar problemas reais.
Por exemplo, uma queda na pontuação total pode não ser devido a uma resposta incorreta, mas sim a um aumento súbito no custo de chamada de ferramentas; um aumento na pontuação total também pode ser baseado em uma redução na segurança.
Ferramenta recomendada: DeepEval
Supports creating custom metrics and scoring different quality dimensions independently.
4. Avaliação de Trajetória | Trajectory Eval
Não avalie apenas a resposta final fornecida pelo Agente, mas também todo o processo de execução da tarefa.
Incluindo:
- Você escolheu a ferramenta correta?
- Are the tools called in a logical order?
- Is it redundant to perform the same invalid action?
- Foram omitidos passos necessários?
- Você ajustou corretamente as decisões com base nos resultados da ferramenta?
O agente pode acabar obtendo a resposta correta, mas o processo intermediário é ineficiente, frágil e até mesmo arriscado.
Ferramenta recomendada: AgentEvals
Você pode verificar as ações, decisões e chamadas de ferramentas do Agent ao longo da trajetória completa.
5. Testes unitários da ferramenta | Tool Unit Tests
Escreva testes independentes para cada ferramenta usada pelo Agente.
Use fixed input to verify fixed output, without involving the model.
Assim, é possível dividir o problema:
Foi o agente que apresentou erro no raciocínio, ou houve problema nas ferramentas, interfaces ou servidor MCP subjacentes?
Só faz sentido avaliar se o Agente chamou corretamente a ferramenta após garantir que a própria ferramenta é confiável.
Ferramenta recomendada: MCP Inspector
Pode ser usado para verificar e testar o MCP Server, os parâmetros da ferramenta e os resultados retornados.
6. Conjunto de teste de regressão | Regression Suite
Save past real execution cases and re-run after each update to prompts, models, or toolsets.
Em seguida, compare os resultados das versões nova e antiga, verifique:
- O task originalmente correto falhou?
- Does the output format change?
- A chamada de ferramentas aumentou?
- Atrasos e custos aumentaram?
- Are certain edge cases degenerating?
O desempenho médio melhor na nova versão não significa que ela não tenha quebrado funcionalidades antigas.
Ferramenta recomendada: Promptfoo
Support running reproducible evaluation suites, catching regression issues, and integrating checks into CI.
7. Testes A/B em produção|A/B Testing in Production
Distribua aleatoriamente o tráfego de usuários reais entre duas versões diferentes e compare seu desempenho em um ambiente real.
Pode testar:
- Dois conjuntos de prompts
- Dois modelos
- Dois fluxos de trabalho de Agent
- Diferentes combinações de ferramentas
- Diferentes estratégias de resposta
A versão com pontuação offline mais alta não necessariamente traz maior sucesso do usuário.
O que realmente importa são os resultados reais, como taxa de conclusão de tarefas, taxa de adoção por usuários, taxa de conversão, taxa de transferência para atendimento humano e taxa de resolução de problemas.
Ferramenta recomendada: GrowthBook
Provide feature toggles, controlled experiments, and product analytics capabilities.
8. Revisão humana | Human Review
Amostras periódicas de registros de operação reais são avaliadas por revisores humanos.
A revisão humana pode não apenas identificar problemas omitidos pela avaliação automatizada, mas também ser usada para calibrar os árbitros LLM.
Precisa ser verificado com atenção:
- A pontuação do modelo está alinhada com o julgamento humano?
- As critérios de avaliação são suficientemente claros?
- O modelo de julgamento favorece respostas mais longas?
- Avaliação automática se há erros graves omitidos
A avaliação automatizada não pode substituir completamente o julgamento humano.
Ferramenta recomendada: Argilla
Ajudar a equipe a coletar feedback humano, revisar as saídas do modelo e transformar os resultados em um conjunto de dados de alta qualidade.
9. Shadow Run
Execute a candidate version on live traffic without displaying its output to users.
O ambiente de produção ainda usa a versão antiga, enquanto a nova versão é executada apenas em segundo plano para comparar o desempenho de ambas.
Este método é adequado para atualizações de alto risco, como:
- Trocar o modelo principal
- Reescrever o prompt do sistema
- Integrar novas ferramentas externas
- Modificar a lógica de decisão do Agent
- Ampliar permissões da ferramenta
Shadow running helps teams identify issues in real traffic before official release, while avoiding direct impact on users.
Ferramenta recomendada: Langfuse
Rastreie execuções de produção, compare versões candidatas e monitore os resultados da avaliação.
10. Testes de Red Team | Red Teaming
Ataque seu próprio sistema antes do atacante.
O escopo do teste inclui:
- Jailbreak attack
- Prompt injection
- Vazamento de dados sensíveis
- Bypass de permissões
- Abuso de ferramentas
- Arquivos ou conteúdo de página web maliciosos
- Operação externa não prevista
Red team testing is especially important for Agents that can access databases, send emails, modify files, execute code, or access internal systems.
Ferramenta recomendada: Garak
Escaneie vulnerabilidades de segurança e comportamentos inseguros no sistema LLM.
Offline evaluation tells you: the system works properly in the testing environment.
A avaliação online informa que o sistema continuará funcionando normalmente após o lançamento.
Você provavelmente não precisa implementar todos os 10 mecanismos de avaliação de uma vez.
Uma abordagem mais prática é:
Revise a última falha do Agent e priorize a implementação dos dois métodos de avaliação que poderiam ter identificado o problema antecipadamente.
Estabelecer primeiro um conjunto de teste de ouro e depois complementar com testes de regressão ou inspeção manual frequentemente evita muitos acidentes simples.
Vale a pena salvar.
