Bevor ein AI Agent Webseiten bedient, sollte die Kette aus Umgebung und Agent in vier Ebenen geprüft werden: Einzelschritt-Smoke-Test, mehrstufige Aufgaben, Parallel-Lasttest und Fehlerinjektion – jeweils mit passenden Kennzahlen.
Ein einmaliger Erfolg in einer Demo-Umgebung bedeutet nicht, dass sich dieselbe Kette täglich zuverlässig einsetzen lässt.
Für eine belastbare Beurteilung muss man die Tests trennen: Die Umgebung wird auf ihrer eigenen Ebene geprüft, der Agent auf seiner Ebene, und anschließend wird kontrolliert, ob beide zusammen stabil bleiben.

Einzelschritt-Smoke-Test: vier Aktionen einzeln prüfen
Der Smoke-Test umfasst nur vier Dinge, jeweils getrennt und nicht als Kette: eine festgelegte Seite öffnen; ein Element auf der Seite finden; darauf klicken; den Text dieses Elements auslesen. Bestehen alle vier, funktionieren die Grundlagen für Verbindung, Sitzung und Elementzugriff.
Die Beschränkung auf vier Einzelaktionen hält die Fehlerfläche klein. Lässt sich die Seite nicht öffnen, liegt es meist am Netzwerk-Ausgang oder an Zugriffsrechten. Öffnet sie sich, aber das Element wird nicht gefunden, war die Seite womöglich noch nicht vollständig geladen oder der Locator hängt zu stark vom aktuellen Layout ab. Wird das Element gefunden, lässt sich aber nicht klicken, sollte geprüft werden, ob es verdeckt ist oder in einem iframe liegt. Ist der zurückgegebene Text leer, muss zuerst sichergestellt werden, dass gerenderter Inhalt statt des ursprünglichen HTML gelesen wird.
Drei Werte sind wichtig: Erfolgsquote pro Einzelschritt, Dauer pro Einzelschritt und Verteilung der Fehlertypen. Diese Werte sollten schon im Smoke-Test stabil sein. Schwankt die Einzelschritt-Erfolgsquote nur um 80–90 %, sind die späteren Tests wenig aussagekräftig.
Mehrstufige Aufgaben: Verzweigungen sind wichtiger als die Schrittzahl
Die vier Aktionen werden zu einer realen Aufgabe verbunden, etwa ein Formular ausfüllen, mehrere Seiten durchgehen, nach Bedingungen filtern und das Ergebnis lokal zurückschreiben. Mehr Schritte erhöhen nur die Menge; die eigentliche Schwierigkeit sind Verzweigungen: Hinweise erscheinen, Zielelemente verschwinden, die Seite leitet selbstständig weiter oder eine Verifizierung verlangt menschliche Bestätigung.
Hier zählt die Aufgaben-Abschlussquote, nicht die Erfolgsquote einzelner Schritte. Wichtiger als ein vollständiger Durchlauf ist, ob der Agent nach einem Fehler den Pfad anpassen kann und erkennt, wann er stoppen und das Problem eindeutig melden muss.
Eine oft übersehene Kennzahl ist die Zahl menschlicher Eingriffe. Wird dieselbe Aufgabe zwanzigmal ausgeführt, zeigen die Anzahl der Eingriffe und die jeweilige Blockierstelle den Reifegrad der Kette oft besser als die Gesamt-Abschlussquote.
Parallelität und Fehlerinjektion
Wenn eine einzelne Kette stabil ist, kommt Parallelität hinzu. Mehrere Umgebungen führen gleichzeitig dieselbe Aufgabenart aus. Dabei wird geprüft, ob sie sich gegenseitig beeinflussen und ob die Fehlerquote mit steigender Parallelität zunimmt. Fehler in dieser Phase entstehen häufig nicht durch falsche Agent-Logik, sondern durch Engpässe bei Ressourcen oder Sitzungen.
Fehlerinjektion wird besonders leicht übersprungen, ist aber besonders wichtig. Timeouts, verschwindende Elemente, abgelaufene Sitzungen und CAPTCHAs sollten absichtlich erzeugt werden, um die Reaktion zu beobachten: Führt ein Timeout nach einem erneuten Versuch zum Erfolg oder hängt der Prozess; meldet die Kette nach Sitzungsablauf klar einen Fehler oder arbeitet sie mit ungültigen Anmeldedaten weiter?
Drei Kennzahlen werden erfasst: Fehlerquotenkurve unter Parallelität, Wiederherstellungsquote nach einer Störung und zusätzliche Dauer pro Störung. Eine niedrige Wiederherstellungsquote zeigt, dass die Kette nur unter günstigen Bedingungen funktioniert.
Die Umgebungsebene separat prüfen
Die bisherigen Tests finden in einer Umgebung statt. Werden mehrere Umgebungen gemeinsam betrieben, muss eine weitere Ebene separat geprüft werden: Jede Umgebung soll unabhängig starten, eigene Sitzungen und Caches halten und an eine eigene Ausgangs-IP gebunden sein.
Teams mit mehreren Konten verwalten Umgebungen meist pro Konto. Werkzeuge wie PurpleMark bieten Umgebungsisolation und damit für jedes Konto einen eigenen Laufzeitbereich. Im Test werden mehrere Umgebungen parallel gestartet; anschließend wird geprüft, dass Cookies, Caches und Ausgänge nicht zwischen ihnen vermischt werden.
Für diese Ebene zählen drei Werte: Erfolgsquote beim Start der Umgebung, Datenüberschneidungen zwischen Umgebungen (normalerweise null) und die Frage, ob eine Sitzung nach dem Neuaufbau einer Umgebung fortgesetzt werden kann.
Fehler richtig zuordnen
Wenn die Kette ausfällt, ist es ein häufiger Fehler, sofort das Agent-Skript zu ändern. Sinnvoller ist diese Reihenfolge: zuerst prüfen, ob die Umgebung startet und die Sitzung gültig ist; danach Netzwerk-Ausgang und Knoten kontrollieren; erst zuletzt die Elementlokalisierung und Aufgabenplanung des Agents verdächtigen. In umgekehrter Reihenfolge wird wiederholt an der falschen Stelle geändert.
Die vier Aktionen des Einzelschritt-Smoke-Tests dienen zugleich zur Fehlerzuordnung. Nach jedem Fehler werden sie einzeln wiederholt, um zu sehen, welches Glied zuerst bricht. Meist zeigt sich die Ursache bereits dort.


