Quay lại blog

Kiểm thử thao tác web của AI Agent: bốn lớp xác minh và chỉ số

Trước khi để AI Agent thao tác trên website, hãy xác minh chuỗi giữa môi trường và Agent theo bốn lớp: smoke test từng bước, tác vụ nhiều bước, kiểm thử tải đồng thời và fault injection, với các chỉ số riêng cho từng lớp.

Chạy thành công một lần trong môi trường demo không đồng nghĩa với việc chuỗi đó có thể được sử dụng ổn định mỗi ngày.

Muốn đánh giá đúng, cần tách bài kiểm thử: xác minh môi trường ở lớp môi trường, xác minh Agent ở lớp Agent, rồi cuối cùng kiểm tra xem hai phần có còn ổn định khi nối lại với nhau hay không.

AI Agent 网页操作测试:四层验证与指标的关键步骤与判断维度示意图

Smoke test từng bước: kiểm tra riêng bốn thao tác

Smoke test chỉ làm bốn việc và thực hiện riêng từng việc, không nối thành chuỗi: mở một page xác định; tìm một element trên page; click vào element; lấy text của element đó. Nếu cả bốn đều qua, nền tảng về connection, session và element access đang hoạt động.

Chỉ kiểm tra bốn thao tác riêng giúp thu hẹp phạm vi lỗi. Nếu không mở được page, nguyên nhân thường nằm ở network egress hoặc quyền truy cập. Nếu mở được nhưng không tìm thấy element, có thể page chưa load xong hoặc locator phụ thuộc quá nhiều vào layout hiện tại. Nếu tìm thấy nhưng không click được, hãy kiểm tra element có bị che hoặc nằm trong iframe hay không. Nếu text trả về rỗng, trước tiên hãy xác nhận đang đọc rendered content chứ không phải HTML ban đầu.

Theo dõi ba con số: single-step success rate, thời gian của từng bước và phân bố loại error. Các chỉ số này phải ổn định ngay từ giai đoạn smoke test. Nếu single-step success rate chỉ dao động quanh 80–90%, các bài kiểm thử sau không còn nhiều ý nghĩa.

Tác vụ nhiều bước: nhánh quan trọng hơn số lượng bước

Nối bốn thao tác trên thành một tác vụ thực tế, chẳng hạn điền form, lật qua nhiều pages, filter theo điều kiện và ghi kết quả trở lại local. Tăng số bước chỉ là thay đổi về lượng; khó khăn thật sự nằm ở các nhánh: xuất hiện prompt, target element biến mất, page tự redirect hoặc gặp bước verification cần người xác nhận.

Ở đây cần nhìn task completion rate, không phải step success rate. Sau một failure, việc Agent có thể tự điều chỉnh đường đi và biết khi nào nên dừng để report rõ ràng quan trọng hơn việc cố chạy hết toàn bộ quy trình.

Một chỉ số khác dễ bị bỏ qua là số lần human intervention. Nếu chạy cùng một task 20 lần, số lần phải can thiệp và vị trí bị kẹt ở mỗi lần có thể phản ánh độ trưởng thành của chuỗi tốt hơn overall completion rate.

Concurrency và fault injection

Khi một chuỗi đơn đã ổn định, hãy bổ sung concurrency. Khởi chạy nhiều environments cùng lúc với cùng loại task và theo dõi xem các environment có can nhiễu lẫn nhau hay không, và failure rate có xấu đi khi concurrency tăng hay không. Failure ở giai đoạn này thường đến từ áp lực lên resource hoặc session, không nhất thiết do Agent logic sai.

Fault injection là loại kiểm thử rất dễ bị bỏ qua nhưng lại đặc biệt cần thiết. Hãy cố ý tạo timeout, element biến mất giữa chừng, session hết hạn và CAPTCHA, rồi quan sát phản ứng: sau timeout, retry có thành công hay process bị treo; sau khi session hết hạn, chuỗi có báo error rõ ràng hay vẫn tiếp tục bằng credential đã mất hiệu lực.

Ghi ba metrics: đường cong failure rate dưới concurrency, recovery success rate sau fault và thời gian tăng thêm do một fault. Recovery success rate thấp cho thấy chuỗi chỉ chạy tốt khi điều kiện thuận lợi.

Xác minh riêng lớp môi trường

Các bài kiểm thử trên diễn ra trong một environment, nhưng khi dùng nhiều environments cùng nhau, cần xác minh riêng thêm một lớp: mỗi environment phải start độc lập, giữ session và cache riêng, đồng thời gắn với egress IP riêng.

Các đội vận hành nhiều accounts thường tách environment theo từng account. Công cụ như PurpleMark cung cấp environment isolation để mỗi account có runtime space độc lập. Khi test, hãy start nhiều environments đồng thời và xác nhận Cookies, cache cùng egress không bị trộn lẫn.

Với lớp này, theo dõi ba con số: environment startup success rate, data cross-talk giữa các environments (bình thường phải bằng 0), và session có thể tiếp tục hay không sau khi rebuild environment.

Cách quy nguyên nhân sau failure

Khi chuỗi gặp vấn đề, lỗi thường gặp là lập tức sửa Agent script. Trình tự hợp lý hơn là trước hết xác nhận environment có start được không và session đã hết hạn chưa, sau đó kiểm tra network egress và nodes, cuối cùng mới nghi ngờ element location và task planning của Agent. Làm ngược thứ tự sẽ dẫn đến sửa đi sửa lại ở sai chỗ.

Bốn thao tác trong single-step smoke test cũng là công cụ quy nguyên nhân. Với bất kỳ failure nào, hãy quay lại chạy bốn thao tác riêng rẽ và xem mắt xích nào đứt trước. Phần lớn trường hợp sẽ tìm ra câu trả lời ngay ở bước này.