Voltar ao blog

Testes de operação web com AI Agent: quatro camadas e métricas

Antes de deixar um AI Agent operar sites, valide a cadeia entre o ambiente e o Agent em quatro camadas: smoke test de etapa única, tarefas em várias etapas, teste de concorrência e injeção de falhas, cada uma com métricas próprias.

Funcionar uma vez em um ambiente de demonstração não significa que a mesma cadeia possa ser usada com confiança todos os dias.

Para avaliar isso, separe os testes: valide o ambiente na camada do ambiente, valide o Agent na camada do Agent e, por fim, verifique se os dois continuam estáveis quando conectados.

AI Agent 网页操作测试:四层验证与指标的关键步骤与判断维度示意图

Smoke test de etapa única: execute quatro ações separadamente

O smoke test faz apenas quatro coisas, uma por vez e sem encadeá-las: abrir uma página definida; localizar um elemento na página; clicar nele; recuperar o texto desse elemento. Se as quatro passarem, a base de conexão, sessão e acesso a elementos está funcionando.

Limitar o teste a quatro ações isoladas reduz muito a área de falha. Se a página não abre, o problema costuma estar no egress de rede ou nas permissões de acesso. Se abre, mas o elemento não é localizado, a página pode ainda não ter terminado de carregar ou o método de localização pode depender demais do layout atual. Se o elemento é localizado, mas não pode ser clicado, verifique se está coberto ou dentro de um iframe. Se o texto retornado estiver vazio, confirme primeiro que você está lendo o conteúdo renderizado, e não o HTML inicial.

Acompanhe três números: taxa de sucesso por etapa, tempo por etapa e distribuição dos tipos de erro. Eles já devem estar estáveis na fase de smoke test. Se a taxa de sucesso de uma única etapa oscilar apenas na faixa de 80–90%, os testes seguintes perdem valor.

Tarefas em várias etapas: ramificações importam mais que o número de etapas

Encadeie as quatro ações em uma tarefa real, como preencher um formulário, navegar por várias páginas, filtrar por condições e gravar o resultado localmente. Aumentar o número de etapas é apenas uma mudança quantitativa; a dificuldade real está nas ramificações: surge um aviso, o elemento-alvo desaparece, a página redireciona sozinha ou aparece uma verificação que exige confirmação humana.

Aqui, a métrica é a taxa de conclusão da tarefa, não a taxa de sucesso das etapas. Depois de uma falha, é mais importante saber se o Agent consegue ajustar o caminho e reconhecer quando deve parar e relatar o problema com clareza do que simplesmente chegar ao fim.

Outro número fácil de ignorar é a quantidade de intervenções humanas. Se a mesma tarefa for executada vinte vezes, quantas intervenções ocorreram e em qual etapa cada execução travou podem mostrar melhor a maturidade da cadeia do que a taxa geral de conclusão.

Concorrência e injeção de falhas

Quando uma cadeia individual estiver estável, adicione concorrência. Inicie vários ambientes ao mesmo tempo executando o mesmo tipo de tarefa e observe se os ambientes interferem entre si e se a taxa de falhas piora conforme a concorrência aumenta. Nessa fase, as falhas muitas vezes vêm de pressão sobre recursos ou sessões, e não de erro na lógica do Agent.

A injeção de falhas é um dos testes mais ignorados e também um dos mais necessários. Provoque deliberadamente timeouts, desaparecimento de elementos, expiração de sessão e CAPTCHAs, e observe a resposta: depois de um timeout, uma nova tentativa funciona ou o processo fica travado; depois que a sessão expira, a cadeia informa um erro claro ou continua com credenciais inválidas?

Registre três métricas: curva da taxa de falhas sob concorrência, taxa de recuperação após uma falha e tempo adicional causado por uma falha. Uma taxa baixa de recuperação indica que a cadeia só funciona quando as condições são favoráveis.

Valide separadamente a camada do ambiente

Os testes anteriores acontecem dentro de um único ambiente, mas, quando vários ambientes são usados juntos, é preciso validar uma camada adicional. Cada ambiente deve iniciar de forma independente, manter sua própria sessão e cache e estar vinculado a seu próprio IP de egress.

Equipes que operam várias contas normalmente separam os ambientes por conta. Ferramentas como PurpleMark oferecem isolamento de ambiente para dar a cada conta um espaço de execução independente. No teste, inicie vários ambientes em paralelo e confirme que Cookies, caches e egress não se misturam.

Para essa camada, acompanhe três números: taxa de sucesso na inicialização do ambiente, vazamento de dados entre ambientes (normalmente deve ser zero) e continuidade da sessão após reconstruir um ambiente.

Como atribuir a causa de uma falha

Quando a cadeia apresenta problemas, um erro comum é alterar imediatamente o script do Agent. Uma ordem mais adequada é primeiro confirmar se o ambiente inicia e se a sessão não expirou, depois verificar o egress de rede e os nós, e só então suspeitar da localização de elementos e do planejamento de tarefas do Agent. Inverter a ordem leva a mudanças repetidas no lugar errado.

As quatro ações do smoke test de etapa única também servem para atribuir a causa. Diante de qualquer falha, execute-as novamente de forma separada e veja qual elo quebra primeiro. Na maioria das vezes, a resposta aparece nesse ponto.