返回部落格

Agent 瀏覽器選型:四類判斷維度與驗證清單

替智慧代理選瀏覽器環境,能不能連上除錯介面從來不是重點。應按任務類型、隔離能力、可控性與可觀測性、接入成本四個維度評估,最後用清單逐項驗證。

替智慧代理挑瀏覽器環境,很多團隊的第一步是試著連上除錯介面。能連上就認為可用。這個門檻太低了,能連上只是入場券,決定任務能不能長期跑下去的是後面這幾件事。

Agent 浏览器选型:四类判断维度与验证清单的关键步骤与判断维度示意图

先看你手上的任務屬於哪一類

單頁確定性操作。開啟一個頁面,填幾欄表單,點一個按鈕,讀回結果。這類任務對環境的要求最低,普通瀏覽器加一個自動化函式庫就能涵蓋,不必額外引入管理層。

多步驟跨站流程。一個任務要在多個網站之間來回,中途還要保持登入狀態、帶著 Cookie、維持同一套裝置身分。到了這一層,環境的要求開始出現:身分要能持續,工作階段之間不能互相污染,中途失敗要能重跑。

需要語意理解的任務。讓模型讀頁面內容,再決定下一步怎麼走。這類任務的失敗點經常不在模型,而在頁面被降級回傳、冒出一個真人驗證,或者環境帶著明顯的自動化特徵導致頁面結構整個變形。環境層穩不穩,直接決定模型拿到的輸入對不對。

這一步不能跳過。用單頁任務的思路去做跨站任務會一直踩坑,反過來給簡單任務套一整套重型基礎設施也是浪費。

隔離能力按規模決定

只有一個身分、低頻率地跑,隔離不是問題。一旦同時操作多個帳號或身分,隔離就成了硬需求,而且要同時看三個層面:瀏覽器指紋、Cookie 與本機儲存、網路出口。

三者不配套時會更麻煩。指紋本身乾淨,但網路出口的歸屬和時區、語言互相矛盾,反而更容易被辨識出來。有個經驗值得記住:判斷存取來源時,IP 只是其中一部分,裝置資訊、Cookie、本機儲存同樣參與判斷,所以換 IP 就夠了這個思路在多帳號場景裡基本不成立。

可控性與可觀測性

可控性指的是環境能不能被程式完整管起來。建立、啟動、查詢狀態、停止、回收,每個動作都有對應的介面,而不是有一環只能人工點介面。只要有一個環節需要人守著,規模就上不去。

可觀測性指的是出問題時你能不能定位。智慧代理是無人值守執行的,頁面上發生了什麼你看不到,手裡只剩日誌。至少要保證在模擬一次連線失敗或環境啟動失敗之後,日誌裡能留下足夠定位到具體環節的資訊,否則排查只能靠猜。

接入成本不只是開發工時

要想清楚幾件事:環境要不要和現有的任務排程系統對接;任務跑完之後環境是留著還是釋放;有沒有現成的介面能接上你正在用的自動化函式庫;這一層日常由誰來維護。開發階段的工時往往不是大頭,後續維護才是。

一份可以照著做的驗證清單

同時啟動兩個環境,存取同一個偵測頁面,對比回傳的裝置特徵是否不同;在一個環境裡登入,確認另一個環境的工作階段不受影響。建立環境、登入、關閉、再啟動,檢查登入狀態和本機資料能否完整恢復。用腳本走完從建立到刪除的完整生命週期,看每一環是否都有介面。把並行量逐步拉到二十、五十、一百,觀察啟動成功率、記憶體占用,以及失敗之後能否自動重試和回收。模擬一次故障,檢查日誌能否定位到具體環節。如果涉及團隊協作,確認權限分級和操作留痕是否具備。

一個判斷原則

單帳號、低頻率、短週期,用普通瀏覽器加自動化函式庫就夠了。出現下面任何一種情況,就該把瀏覽器環境當成獨立的一層來建設:多帳號並行且需要互不干擾,任務要長期維持登入狀態,並行規模會繼續成長,有團隊多人協作。PurpleMark 提供的就是這一層能力,把瀏覽器環境做成可隔離、可持久化、可透過介面排程的資源,讓智慧代理專注在任務邏輯本身。

僅用於技術研究與開發實務分享,請在合法合規前提下使用。