Terug naar blog

Webbewerkingen met een AI Agent testen: vier lagen en meetwaarden

Voordat een AI Agent websites bedient, test je de keten tussen omgeving en Agent in vier lagen: een single-step smoketest, meerstapstaken, gelijktijdige belasting en foutinjectie, elk met eigen meetwaarden.

Eén succesvolle run in een demo-omgeving is niet hetzelfde als een keten die elke dag betrouwbaar bruikbaar is.

Voor een goede beoordeling moet je de tests opsplitsen: valideer de omgeving op haar eigen laag, valideer de Agent op zijn laag en controleer daarna of beide samen stabiel blijven.

AI Agent 网页操作测试:四层验证与指标的关键步骤与判断维度示意图

Single-step smoketest: voer vier acties apart uit

De smoketest doet slechts vier dingen, één voor één en niet als keten: een opgegeven pagina openen; een element op de pagina vinden; erop klikken; de tekst van dat element ophalen. Als alle vier slagen, werken de basisvoorzieningen voor verbinding, sessie en elementtoegang.

Door de test tot vier losse acties te beperken, blijft het foutoppervlak klein. Kan de pagina niet worden geopend, dan ligt het meestal aan netwerk-egress of toegangsrechten. Opent de pagina wel maar wordt het element niet gevonden, dan was de pagina mogelijk nog niet volledig geladen of is de locator te afhankelijk van de huidige lay-out. Wordt het element wel gevonden maar kan er niet op worden geklikt, controleer dan of het wordt bedekt of in een iframe staat. Is de opgehaalde tekst leeg, controleer dan eerst of de gerenderde inhoud wordt gelezen in plaats van de oorspronkelijke HTML.

Let op drie cijfers: succespercentage per stap, tijd per stap en verdeling van fouttypen. Die moeten al in de smokefase stabiel zijn. Als het single-step succespercentage slechts rond 80–90% schommelt, hebben latere tests weinig betekenis.

Meerstapstaken: vertakkingen zijn belangrijker dan het aantal stappen

Koppel de vier acties tot een echte taak, bijvoorbeeld een formulier invullen, meerdere pagina's doorlopen, op voorwaarden filteren en het resultaat lokaal terugschrijven. Meer stappen zijn alleen een kwantitatieve verandering; de echte moeilijkheid zit in vertakkingen: er verschijnt een melding, het doelelement verdwijnt, de pagina stuurt automatisch door of een verificatiestap vraagt om menselijke bevestiging.

Hier telt het voltooiingspercentage van de taak, niet het succespercentage van losse stappen. Na een fout is het belangrijker dat de Agent zijn route kan aanpassen en kan bepalen wanneer hij moet stoppen en het probleem duidelijk moet melden dan dat hij koste wat kost het einde haalt.

Een andere vaak vergeten waarde is het aantal menselijke ingrepen. Als dezelfde taak twintig keer wordt uitgevoerd, laten het aantal ingrepen en de stap waarop elke run vastloopt de volwassenheid van de keten vaak beter zien dan het totale voltooiingspercentage.

Gelijktijdigheid en foutinjectie

Zodra één keten stabiel is, voeg je gelijktijdigheid toe. Start meerdere omgevingen tegelijk met hetzelfde soort taak en observeer of omgevingen elkaar beïnvloeden en of het foutpercentage verslechtert wanneer de gelijktijdigheid toeneemt. Fouten in deze fase komen vaak niet door Agent-logica, maar door druk op resources of sessies.

Foutinjectie wordt vaak overgeslagen, maar is juist zeer belangrijk. Maak bewust time-outs, verdwijnende elementen, verlopen sessies en CAPTCHAs en bekijk de reactie: slaagt een retry na een time-out of blijft het proces hangen; geeft de keten na het verlopen van een sessie een duidelijke fout of gaat hij door met ongeldige inloggegevens?

Leg drie meetwaarden vast: de foutpercentagecurve onder gelijktijdigheid, het herstelpercentage na een fout en de extra tijd die één fout veroorzaakt. Een laag herstelpercentage betekent dat de keten alleen onder gunstige omstandigheden goed werkt.

Valideer de omgevingslaag apart

De bovenstaande tests worden in één omgeving uitgevoerd, maar bij meerdere omgevingen samen moet een extra laag afzonderlijk worden gevalideerd. Elke omgeving moet zelfstandig kunnen starten, een eigen sessie en cache hebben en aan een eigen egress-IP zijn gekoppeld.

Teams die meerdere accounts beheren, splitsen omgevingen meestal per account. Tools zoals PurpleMark bieden omgevingsisolatie, zodat elk account een eigen uitvoeringsruimte heeft. Start tijdens de test meerdere omgevingen tegelijk en controleer dat Cookies, caches en egress niet door elkaar lopen.

Kijk voor deze laag naar drie cijfers: succespercentage bij het starten van de omgeving, gegevenskruisbesmetting tussen omgevingen (normaal nul) en of de sessie na het opnieuw opbouwen van een omgeving kan worden voortgezet.

Fouten correct toewijzen

Wanneer de keten faalt, is het een veelgemaakte fout om meteen het Agent-script aan te passen. Een betere volgorde is eerst controleren of de omgeving kan starten en de sessie niet is verlopen, daarna netwerk-egress en nodes bekijken, en pas als laatste de elementlokalisatie en taakplanning van de Agent verdenken. In de omgekeerde volgorde blijf je wijzigingen op de verkeerde plek maken.

De vier acties van de single-step smoketest zijn ook hulpmiddelen voor fouttoewijzing. Voer ze na elke fout opnieuw afzonderlijk uit en kijk welke schakel het eerst breekt. Meestal is de oorzaak dan al zichtbaar.