Windows Errors? Fix Them Before They Spread
Repair common Windows errors and clear accumulated junk for a smoother, more stable PC - no reinstall needed.Free scan · no reinstallCrashes, No Sound, or Screen Glitches?
Random freezes, missing sound and display glitches usually trace back to one bad driver. Find and replace yours safely.Free scan · under a minuteiTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more
Para testar um sistema multiagente com ADK, verifique não só a resposta final, mas também se o agente principal delegou corretamente, quais ferramentas foram chamadas e o que os subagentes responderam. Use arquivos de teste de sessão simples durante o desenvolvimento e evalsets para integrações mais longas; depois, compare execuções com referências revisadas para identificar regressões.
O que um teste multiagente precisa verificar
Uma resposta final plausível não prova que o sistema coordenou os agentes corretamente. A documentação do ADK sobre avaliação recomenda avaliar o resultado e a trajetória que levou a ele: ações, decisões e chamadas de ferramentas. Em um cenário multiagente, registre também as respostas intermediárias dos subagentes e confira se o agente principal as integrou como esperado.
- Resultado: a resposta final atende à tarefa e aos critérios de sucesso?
- Delegação: o agente principal chamou o subagente adequado, quando necessário?
- Trajetória: as etapas e chamadas de ferramentas esperadas ocorreram, sem ações indevidas ou passos essenciais ausentes?
- Integração: as respostas dos subagentes foram aproveitadas corretamente na resposta final?
Defina esses critérios por cenário. Uma métrica que verifica apenas a resposta final não demonstra que a coordenação entre agentes funcionou.
Do these 3 things before closing this tab:
1Fix the driver behind crashes, sound loss and screen glitches2Clear out junk files and repair common Windows errors3Scan for outdated or missing drivers - takes under a minuteComo estruturar a avaliação
1. Defina tarefas e sinais de sucesso
Escolha tarefas representativas e descreva o resultado correto, as delegações importantes, as chamadas de ferramentas necessárias e as respostas intermediárias relevantes. Quanto mais explícitas forem as expectativas, mais fácil será distinguir uma falha de coordenação de uma variação aceitável na resposta.
#1 Best Overall
2. Comece com poucos casos centrais
O guia do agents-cli recomenda começar com um ou dois casos que cubram o comportamento mais importante. Execute-os, examine as falhas, ajuste instruções, ferramentas ou lógica e repita. Amplie a cobertura quando esses casos estiverem funcionando.
3. Escolha o formato conforme a fase
| Formato | Quando usar | O que pode registrar |
|---|---|---|
Arquivo de teste .test.json |
Desenvolvimento ativo e ciclos rápidos; representa uma sessão simples. | Um ou mais turnos, uso intermediário de ferramentas, respostas de agentes e resposta final. |
| Evalset | Testes de integração menos frequentes, com cenários mais complexos e sessões potencialmente longas. | Várias sessões de avaliação, adequadas a conversas mais extensas. |
Essas distinções e os campos de teste são descritos na documentação de avaliação do ADK. Um arquivo de teste pequeno ajuda a iterar depressa; não substitui a avaliação de conversas e integrações mais amplas.
4. Execute casos e aplique métricas compatíveis
No fluxo documentado do agents-cli, agents-cli eval run executa os casos do dataset e aplica as métricas configuradas. Também é possível separar a geração de traces da classificação, o que permite inspecionar as execuções ou classificá-las novamente. Consulte o guia oficial do agents-cli para os detalhes do fluxo, que podem mudar entre versões.
Quick wins for a faster PC:
Clear out junk files and repair common Windows errorsFree Scan →Fix the driver behind crashes, sound loss and screen glitchesFind Drivers →O guia lista métricas para qualidade geral, uso de ferramentas, trajetória e sucesso de tarefa em várias interações, correspondência com uma resposta de referência, alucinação, grounding e segurança. Porém, segundo esse guia, somente as métricas de sucesso da tarefa multi-turn, qualidade da trajetória multi-turn e qualidade de uso de ferramentas multi-turn aceitam traces multi-turn; outras métricas integradas rejeitam esse formato. Confirme que a métrica escolhida aceita o tipo de execução que você gerou.
Rank #3
5. Compare com referências para detectar regressões
O ADK documenta testes de conformidade que comparam o comportamento atual com interações de referência registradas anteriormente. No modo Replay, requisições, respostas e chamadas de ferramentas são comparadas com os registros. Mantenha referências revisadas e atualize-as quando uma mudança intencional alterar a trajetória; caso contrário, uma mudança esperada pode ser sinalizada como regressão.
6. Amplie a avaliação com critério
O agents-cli também documenta recursos para gerar cenários multi-turn, comparar resultados, agrupar falhas e otimizar prompts. Eles são mais úteis quando os casos e os critérios já estão bem definidos. Revise o que cada métrica realmente avalia: uma pontuação não garante que todos os modos de falha de produção foram cobertos.
Rank #4
Como analisar falhas de coordenação
Ao investigar um caso que falhou, examine a execução na ordem em que ocorreu: se a delegação prevista aconteceu, quais ferramentas foram chamadas, o que cada agente retornou e como o agente principal usou essas respostas. Essa leitura ajuda a localizar se o problema está na escolha do subagente, em uma etapa ausente, em uma chamada inadequada ou na síntese final.
- Se uma ferramenta ou delegação essencial não ocorreu, confira as instruções e a lógica que deveriam acioná-la.
- Se a resposta intermediária está errada ou incompleta, investigue o cenário e o comportamento do subagente correspondente.
- Se as etapas ocorreram, mas a resposta final não atende ao critério, verifique como o agente principal integrou os resultados.
- Se uma comparação com referência falhar após uma mudança intencional, revise e atualize a baseline em vez de ignorar a diferença sem análise.
A avaliação revela o que aconteceu nos cenários registrados; não comprova que o conjunto detectará todas as falhas possíveis em produção. A cobertura depende dos casos, critérios e traces escolhidos.
Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.CLI local, integração e observabilidade
O tutorial do agents-cli apresenta uma estrutura de projeto com tests/unit, tests/integration e um diretório tests/eval para dataset e configuração de métricas. É um ponto de partida para organizar testes e avaliação, não uma garantia de cobertura multiagente completa. O tutorial lista Python 3.11 ou superior e uv como pré-requisitos e aceita credenciais da Gemini API ou do Google Cloud para o fluxo de exemplo. Veja o tutorial e a documentação do agents-cli para os detalhes sujeitos a mudanças.
Para equipes que precisam de observabilidade e gestão de avaliações além do fluxo local, a página oficial documenta a integração do ADK com Freeplay. Ela descreve observabilidade de chamadas de agentes, LLMs e ferramentas, gestão de prompts, avaliações online e offline, datasets e testes em lote no nível do prompt ou do agente de ponta a ponta. Trata-se de uma opção de terceiros, não de um requisito para testar com ADK.
Limites ao interpretar resultados
As métricas e comparações ajudam a avaliar os comportamentos que seus casos representam, mas não constituem prova de cobertura total nem garantia de desempenho em produção. Não há, nas fontes oficiais citadas, um benchmark aplicável que quantifique quanto um método específico melhora a avaliação de sistemas multiagentes. Trate métricas qualitativas e avaliações por juiz de modelo como sinais a interpretar, não como substitutos de critérios claros e inspeção das trajetórias.
Quick Recap
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

