Перед тем как поручать AI Agent работу с веб-сайтами, проверьте связку среды и Agent на четырех уровнях: одношаговый smoke-тест, многошаговые задачи, параллельная нагрузка и инъекция сбоев, с отдельными метриками для каждого уровня.
Один успешный запуск в демонстрационной среде не означает, что та же связка будет надежно работать каждый день.
Для оценки тесты нужно разделить: среду проверять на уровне среды, Agent — на уровне Agent, а затем смотреть, остается ли вся связка стабильной после их соединения.

Одношаговый smoke-тест: четыре действия по отдельности
Smoke-тест включает только четыре действия, и каждое выполняется отдельно, без объединения в цепочку: открыть заданную страницу; найти на странице элемент; нажать на него; получить текст этого элемента. Если все четыре проходят, базовые механизмы соединения, сессии и доступа к элементам работают.
Четыре изолированных действия сильно сужают область поиска ошибки. Если страница не открывается, причина чаще всего в сетевом egress или правах доступа. Если страница открывается, но элемент не находится, возможно, загрузка еще не завершилась или locator слишком зависит от текущей верстки. Если элемент найден, но на него нельзя нажать, проверьте, не перекрыт ли он и не находится ли в iframe. Если возвращается пустой текст, сначала убедитесь, что читается отрисованный контент, а не исходный HTML.
Следите за тремя показателями: успешность одного шага, время одного шага и распределение типов ошибок. Уже на этапе smoke-теста они должны быть стабильными. Если успешность отдельного шага колеблется лишь около 80–90%, последующие тесты малоинформативны.
Многошаговые задачи: ветвления важнее числа шагов
Соедините четыре действия в реальную задачу, например заполнение формы, переход по нескольким страницам, фильтрацию по условиям и локальную запись результата. Увеличение числа шагов — лишь количественное изменение; настоящая сложность заключается в ветвлениях: появляется уведомление, исчезает целевой элемент, страница сама перенаправляет пользователя или возникает проверка, требующая подтверждения человеком.
Здесь важна доля завершенных задач, а не успешность отдельных шагов. После сбоя важнее, умеет ли Agent изменить маршрут и понять, когда нужно остановиться и ясно сообщить о проблеме, чем просто дойти до конца.
Еще один показатель, который легко упустить, — число вмешательств человека. Если одну задачу запустить двадцать раз, количество вмешательств и шаг, на котором каждый раз возникала остановка, могут лучше показать зрелость связки, чем общий процент завершения.
Параллельность и инъекция сбоев
Когда одиночная связка стала стабильной, добавьте параллельность. Запустите несколько сред одновременно с задачами одного типа и наблюдайте, мешают ли среды друг другу и растет ли доля ошибок с увеличением параллельности. На этом этапе сбои часто вызваны не ошибкой логики Agent, а нехваткой ресурсов или давлением на сессии.
Инъекция сбоев — один из самых часто пропускаемых и одновременно самых необходимых тестов. Намеренно создавайте timeout, исчезновение элемента во время выполнения, истечение сессии и CAPTCHA и смотрите на реакцию: приводит ли повторная попытка после timeout к успеху или процесс зависает; после истечения сессии появляется ли понятная ошибка или работа продолжается с недействительными учетными данными.
Фиксируйте три метрики: кривую доли ошибок при параллельности, успешность восстановления после сбоя и дополнительное время, вызванное одним сбоем. Низкая успешность восстановления означает, что связка работает только в благоприятных условиях.
Уровень среды проверяйте отдельно
Предыдущие тесты выполняются в одной среде, но при совместной работе нескольких сред нужно отдельно проверить еще один уровень. Каждая среда должна запускаться независимо, хранить собственную сессию и cache и использовать собственный egress IP.
Команды, работающие с несколькими аккаунтами, обычно разделяют среды по аккаунтам. Инструменты вроде PurpleMark обеспечивают изоляцию сред, чтобы у каждого аккаунта было независимое пространство выполнения. Во время теста одновременно запустите несколько сред и убедитесь, что Cookies, cache и egress не смешиваются между ними.
Для этого уровня смотрите на три показателя: успешность запуска среды, перетекание данных между средами (в норме должно быть нулевым) и возможность продолжить сессию после пересоздания среды.
Как определить источник сбоя
Когда связка ломается, распространенная ошибка — сразу менять скрипт Agent. Более разумный порядок: сначала убедиться, что среда запускается и сессия не истекла, затем проверить сетевой egress и узлы, и лишь потом подозревать локализацию элементов и планирование задач Agent. Обратный порядок приводит к повторным изменениям не в том месте.
Четыре действия одношагового smoke-теста одновременно служат инструментом диагностики. После любого сбоя снова выполните их по отдельности и посмотрите, какое звено рвется первым. В большинстве случаев причина становится понятна уже на этом этапе.


