Bumalik sa blog

Pagsubok sa Web Operation ng AI Agent: Apat na Antas at Mga Sukatan

Bago hayaang mag-operate ng website ang isang AI Agent, tiyaking maayos ang chain ng environment at Agent sa apat na antas: single-step smoke test, multi-step task, concurrency stress test, at fault injection, na may sariling mahahalagang sukatan.

Magkaiba ang isang beses na matagumpay sa demo environment at ang isang chain na maaasahang gamitin araw-araw.

Para makapagpasya nang tama, paghiwalayin ang pagsusuri: i-validate ang environment sa sarili nitong antas, i-validate ang Agent sa antas nito, at saka tingnan kung matatag ang dalawa kapag pinagsama.

AI Agent 网页操作测试:四层验证与指标的关键步骤与判断维度示意图

Single-step smoke test: gawin nang hiwalay ang apat na aksyon

Apat lang ang gagawin sa smoke test at isa-isa ang mga ito, hindi magkakadugtong: magbukas ng tinukoy na page; hanapin ang isang element sa page; i-click ito; kunin ang text ng element. Kapag pumasa ang apat, gumagana ang pundasyon ng connection, session, at element access.

Maliit ang failure surface kapag apat na hiwalay na aksyon lang ang sinusuri. Kapag hindi mabuksan ang page, kadalasan ay network egress o access permission ang problema. Kapag nabuksan ngunit hindi mahanap ang element, maaaring hindi pa tapos mag-load ang page o masyadong nakadepende sa kasalukuyang layout ang locator. Kapag nahanap ngunit hindi ma-click, tingnan kung natatakpan ito o nasa iframe. Kapag blangko ang nakuha na text, tiyaking rendered content ang binabasa at hindi ang unang HTML.

Tatlong numero ang bantayan: success rate ng bawat hakbang, tagal ng bawat hakbang, at distribusyon ng mga uri ng error. Dapat matatag na ang mga ito sa smoke-test stage. Kung nasa 80–90% lang at pabago-bago ang single-step success rate, hindi magiging makabuluhan ang mga susunod na test.

Multi-step task: mas mahalaga ang mga branch kaysa dami ng hakbang

Pagdugtungin ang apat na aksyon bilang isang totoong gawain, gaya ng pagsagot ng form, paglipat sa ilang page, pag-filter ayon sa kondisyon, at pagsulat ng resulta pabalik sa local. Ang pagdami ng hakbang ay dami lang; ang tunay na hirap ay ang mga branch: may biglang prompt, nawawala ang target element, kusang nagre-redirect ang page, o may verification na kailangan ng kumpirmasyon ng tao.

Task completion rate ang dapat tingnan dito, hindi step success rate. Pagkatapos ng failure, mas mahalaga kung kayang mag-adjust ng Agent ng path at malaman kung kailan dapat huminto at malinaw na mag-report kaysa sa simpleng pagtapos sa buong flow.

Isa pang madalas makaligtaang sukatan ang dami ng human intervention. Kung tatakbo nang dalawampung beses ang parehong task, mas malinaw na ipinapakita ng bilang ng intervention at kung saang hakbang ito natigil ang maturity ng chain kaysa sa kabuuang completion rate.

Concurrency at fault injection

Kapag matatag na ang isang chain, saka magdagdag ng concurrency. Magpatakbo nang sabay ng ilang environment para sa parehong uri ng task at tingnan kung nagkakaabala ang mga environment at kung tumataas ang failure rate habang dumarami ang kasabay na run. Sa yugtong ito, madalas na resource o session pressure ang sanhi at hindi maling Agent logic.

Ang fault injection ay isa sa pinakamadalas laktawan ngunit pinakamahalagang test. Sadyang gumawa ng timeout, pagkawala ng element, expired session, at CAPTCHA, at obserbahan ang tugon: pagkatapos ng timeout, nagtatagumpay ba ang retry o nakabitin ang proseso; pagkatapos mag-expire ang session, malinaw bang nag-e-error o nagpapatuloy gamit ang invalid na credential?

Itala ang tatlong metric: failure-rate curve sa ilalim ng concurrency, recovery success rate pagkatapos ng fault, at dagdag na oras na dulot ng isang fault. Kapag mababa ang recovery success rate, gumagana lang ang chain kapag paborable ang kondisyon.

I-validate nang hiwalay ang environment layer

Nasa iisang environment ang mga naunang test, pero kapag maraming environment ang sabay na ginagamit, kailangan ng hiwalay na validation layer: dapat makapag-start nang sarili ang bawat environment, magkaroon ng sariling session at cache, at nakatali sa sariling egress IP.

Karaniwang hinahati ng mga team na nagpapatakbo ng maraming account ang environment kada account. Ang mga tool gaya ng PurpleMark ay nagbibigay ng environment isolation para magkaroon ng sariling runtime space ang bawat account. Sa test, mag-start nang sabay ng ilang environment at tiyaking hindi naghahalo ang Cookies, cache, at egress ng bawat isa.

Tatlong numero ang mahalaga sa layer na ito: environment startup success rate, data cross-talk sa pagitan ng mga environment (dapat zero sa normal na kondisyon), at kung nagpapatuloy ang session matapos muling buuin ang environment.

Paano tukuyin ang pinagmulan ng failure

Kapag nagkaproblema ang chain, karaniwang pagkakamali ang agad na pagbabago sa Agent script. Mas maayos na unahin ang pagsuri kung nakakapag-start ang environment at kung valid pa ang session, pagkatapos ay tingnan ang network egress at mga node, at saka lang pagdudahan ang element location at task planning ng Agent. Kapag baligtad ang pagkakasunod, paulit-ulit na mababago ang maling bahagi.

Ang apat na aksyon sa single-step smoke test ay tool din sa pagtukoy ng sanhi. Sa anumang failure, ulitin ang apat nang magkakahiwalay at tingnan kung aling link ang unang napuputol. Kadalasan, doon pa lang makikita na ang sagot.