Înainte ca un AI Agent să opereze site-uri web, validați lanțul dintre mediu și Agent pe patru niveluri: smoke test cu un singur pas, sarcini cu mai mulți pași, test de concurență și injectarea erorilor, fiecare cu indicatorii săi.
Faptul că o rulare reușește o dată într-un mediu demonstrativ nu înseamnă că același lanț poate fi folosit fiabil în fiecare zi.
Pentru o evaluare corectă, separați testele: validați mediul la nivelul lui, validați Agentul la nivelul lui, apoi verificați dacă cele două rămân stabile când sunt conectate.

Smoke test cu un singur pas: patru acțiuni separat
Smoke testul face doar patru lucruri, fiecare separat și fără a le lega într-un flux: deschide o pagină specificată; localizează un element pe pagină; face click pe el; preia textul acelui element. Dacă toate patru reușesc, baza pentru conexiune, sesiune și acces la elemente funcționează.
Limitarea la patru acțiuni separate îngustează zona de eroare. Dacă pagina nu se deschide, problema este de obicei la egress-ul de rețea sau la permisiunile de acces. Dacă pagina se deschide, dar elementul nu este găsit, este posibil ca încărcarea să nu se fi încheiat sau locatorul să depindă prea mult de layout-ul curent. Dacă elementul este găsit, dar nu poate fi apăsat, verificați dacă este acoperit sau se află într-un iframe. Dacă textul returnat este gol, confirmați mai întâi că se citește conținutul randat, nu HTML-ul inițial.
Urmăriți trei valori: rata de succes a unui singur pas, durata unui pas și distribuția tipurilor de erori. Acestea ar trebui să fie deja stabile în etapa de smoke test. Dacă rata de succes a unui pas oscilează doar în jur de 80–90%, testele ulterioare au valoare redusă.
Sarcini cu mai mulți pași: ramurile contează mai mult decât numărul de pași
Legați cele patru acțiuni într-o sarcină reală, de exemplu completarea unui formular, parcurgerea mai multor pagini, filtrarea după condiții și scrierea rezultatului local. Mai mulți pași înseamnă doar o schimbare cantitativă; dificultatea reală este reprezentată de ramuri: apare un mesaj, dispare elementul țintă, pagina redirecționează singură sau apare o verificare ce necesită confirmare umană.
Aici contează rata de finalizare a sarcinii, nu rata de succes a pașilor. După o eroare, este mai important dacă Agentul își poate ajusta traseul și poate decide când să se oprească și să raporteze clar problema decât să ajungă pur și simplu la final.
O altă valoare ușor de ignorat este numărul de intervenții umane. Dacă aceeași sarcină este rulată de douăzeci de ori, numărul intervențiilor și pasul la care s-a blocat fiecare rulare pot descrie maturitatea lanțului mai bine decât rata generală de finalizare.
Concurență și injectarea erorilor
După ce un singur lanț devine stabil, adăugați concurență. Porniți mai multe medii simultan cu același tip de sarcină și urmăriți dacă mediile se influențează reciproc și dacă rata de eșec se înrăutățește pe măsură ce crește concurența. În această etapă, erorile sunt adesea cauzate de presiune asupra resurselor sau sesiunilor, nu de logica Agentului.
Injectarea erorilor este unul dintre testele cel mai des omise și, în același timp, unul dintre cele mai necesare. Creați în mod deliberat timeouts, dispariția elementelor, expirarea sesiunii și CAPTCHAs și observați reacția: după un timeout, o reîncercare reușește sau procesul rămâne blocat; după expirarea sesiunii, lanțul raportează clar eroarea sau continuă cu credențiale invalide?
Înregistrați trei indicatori: curba ratei de eșec sub concurență, rata de recuperare după o eroare și timpul suplimentar cauzat de o singură eroare. O rată mică de recuperare arată că lanțul funcționează doar în condiții favorabile.
Validați separat nivelul mediului
Testele de mai sus se fac într-un singur mediu, dar când mai multe medii sunt folosite împreună trebuie validat separat încă un nivel. Fiecare mediu trebuie să pornească independent, să își păstreze propria sesiune și propriul cache și să fie legat de propriul IP de egress.
Echipele care operează mai multe conturi separă de obicei mediile pe cont. Instrumente precum PurpleMark oferă izolare de mediu, astfel încât fiecare cont să aibă un spațiu de rulare independent. În test, porniți mai multe medii în paralel și confirmați că Cookies, cache-urile și egress-ul nu se amestecă.
Pentru acest nivel, urmăriți trei valori: rata de succes la pornirea mediului, contaminarea datelor între medii (în mod normal zero) și dacă sesiunea poate continua după reconstruirea mediului.
Cum atribuiți cauza unei erori
Când lanțul are probleme, o greșeală frecventă este modificarea imediată a scriptului Agentului. O ordine mai bună este să verificați întâi dacă mediul pornește și dacă sesiunea nu a expirat, apoi egress-ul de rețea și nodurile, iar abia la final localizarea elementelor și planificarea sarcinilor de către Agent. Ordinea inversă duce la modificări repetate în locul greșit.
Cele patru acțiuni din smoke test sunt și un instrument de atribuire. După orice eșec, rulați-le din nou separat și vedeți care verigă se rupe prima. De cele mai multe ori, cauza devine clară în acel punct.


