AI Agent को वेबसाइट चलाने देने से पहले environment और Agent की पूरी chain को चार स्तरों पर जाँचें: single-step smoke test, multi-step task, concurrency stress test और fault injection; हर स्तर के लिए अलग मेट्रिक्स रखें।
डेमो environment में एक बार सफल होना और उसी chain का रोज़ भरोसेमंद तरीके से चलना दो अलग बातें हैं।
सही आकलन के लिए टेस्ट अलग करें: environment को उसकी परत पर जाँचें, Agent को उसकी परत पर जाँचें, और अंत में देखें कि दोनों जुड़ने पर स्थिर रहते हैं या नहीं।

Single-step smoke test: चार काम अलग-अलग करें
Smoke test में केवल चार काम हों और हर काम स्वतंत्र रूप से किया जाए, chain बनाकर नहीं: तय page खोलना; page पर किसी element को ढूँढना; उस पर click करना; उस element का text वापस लेना। चारों सफल हों तो connection, session और element access की बुनियादी व्यवस्था काम कर रही है।
चार अलग काम रखने से failure surface बहुत छोटा रहता है। Page न खुले तो समस्या अक्सर network egress या access permission में होती है। Page खुल जाए लेकिन element न मिले तो संभव है page पूरी तरह load न हुआ हो या locator मौजूदा layout पर बहुत निर्भर हो। Element मिल जाए लेकिन click न हो तो देखें कि वह ढका हुआ है या iframe में है। Text खाली आए तो पहले पुष्टि करें कि rendered content पढ़ा जा रहा है, शुरुआती HTML नहीं।
यहाँ तीन आँकड़े देखें: single-step success rate, हर step का समय और error types का distribution। Smoke stage में ही ये स्थिर होने चाहिए। यदि single-step success rate केवल 80–90% के आसपास ऊपर-नीचे हो, तो आगे के टेस्ट का खास अर्थ नहीं रह जाता।
Multi-step task: steps की संख्या से अधिक महत्वपूर्ण branches हैं
इन चार actions को एक वास्तविक task में जोड़ें, जैसे form भरना, कई pages पलटना, conditions के आधार पर filter करना और result को local में वापस लिखना। Steps बढ़ना केवल मात्रा का बदलाव है; असली कठिनाई branches हैं: बीच में prompt आना, target element गायब होना, page का खुद redirect होना या ऐसी verification आना जिसमें human confirmation चाहिए।
यहाँ task completion rate देखें, step success rate नहीं। Failure के बाद Agent रास्ता बदल सकता है या नहीं, और कब रुककर समस्या को साफ़ तरीके से report करना चाहिए यह पहचान सकता है या नहीं—यह पूरे flow को किसी भी कीमत पर पूरा करने से अधिक महत्वपूर्ण है।
एक और अक्सर छूट जाने वाला आँकड़ा human intervention की संख्या है। एक ही task को बीस बार चलाने पर कितनी बार intervention चाहिए और हर बार किस step पर अटका, यह overall completion rate से अधिक अच्छी तरह chain की maturity दिखा सकता है।
Concurrency और fault injection
एक single chain स्थिर हो जाए तो concurrency जोड़ें। एक ही तरह का task कई environments में एक साथ चलाएँ और दो बातें देखें: environments एक-दूसरे को प्रभावित करते हैं या नहीं, और concurrency बढ़ने पर failure rate खराब होता है या नहीं। इस stage के failures अक्सर Agent logic की गलती नहीं, बल्कि resources या sessions पर दबाव का परिणाम होते हैं।
Fault injection सबसे अधिक छोड़े जाने वाले tests में से एक है और सबसे आवश्यक भी। जानबूझकर timeout, element का गायब होना, session expiry और CAPTCHA जैसी स्थितियाँ बनाएं, फिर देखें chain कैसे प्रतिक्रिया देती है: timeout के बाद retry सफल होता है या process अटक जाता है; session expire होने पर स्पष्ट error मिलता है या invalid credentials के साथ आगे चलता रहता है।
तीन metrics दर्ज करें: concurrency के तहत failure-rate curve, fault के बाद recovery success rate और एक fault से जुड़ा अतिरिक्त समय। Recovery success rate कम हो तो chain केवल अनुकूल परिस्थितियों में भरोसेमंद है।
Environment layer को अलग से जाँचें
ऊपर के tests एक environment के भीतर होते हैं, लेकिन कई environments साथ चलें तो एक अतिरिक्त layer को अलग जाँचना चाहिए: हर environment स्वतंत्र रूप से start हो, अपनी session और cache रखे, और अपनी egress IP से जुड़ा हो।
Multiple accounts चलाने वाली teams आम तौर पर हर account के लिए अलग environment रखती हैं। PurpleMark जैसे tools environment isolation देते हैं ताकि हर account को अलग runtime space मिले। Test के दौरान कई environments को साथ start करें और सुनिश्चित करें कि Cookies, cache और egress आपस में mix न हों।
इस layer के लिए तीन आँकड़े देखें: environment startup success rate, environments के बीच data cross-talk (सामान्य स्थिति में zero), और environment rebuild होने के बाद session जारी रह पाती है या नहीं।
Failure का कारण कैसे तय करें
Chain में समस्या आने पर एक आम गलती है कि सीधे Agent script बदलना शुरू कर दिया जाए। बेहतर क्रम है: पहले देखें environment start हो रहा है या नहीं और session expire तो नहीं हुई; फिर network egress और nodes जाँचें; और आखिर में Agent की element location और task planning पर शक करें। उल्टा क्रम अपनाने से बार-बार गलत जगह बदलाव होते हैं।
Single-step smoke test के चार actions कारण पता करने का tool भी हैं। किसी failure के बाद चारों को फिर अलग-अलग चलाएँ और देखें कौन-सा link पहले टूटता है। अधिकतर मामलों में उत्तर इसी step पर मिल जाता है।


