Quay lại blog

Bốn dạng trình duyệt AI và phạm vi phù hợp của từng dạng

Thanh bên AI, trình duyệt do Agent điều khiển, trình duyệt cách ly trên đám mây và trình duyệt có quản lý môi trường giải quyết những bài toán rất khác nhau. Trước khi chọn, cần xác định nhu cầu là hiểu nội dung, thực thi hay điều phối ở quy mô lớn.

Ngày nay, cụm từ “trình duyệt AI” được dùng với phạm vi rất rộng. Một trình duyệt có hộp trò chuyện có thể được gọi là trình duyệt AI; một môi trường trình duyệt được chương trình xem như tài nguyên có thể lập lịch cũng có thể mang tên đó.

Tên gọi giống nhau nhưng vấn đề giải quyết lại khác biệt lớn. Thay vì xem từng sản phẩm riêng lẻ, chia chúng thành bốn dạng rồi xem mỗi dạng làm được gì và vướng ở đâu sẽ rõ ràng hơn.

AI 浏览器的四种形态与各自的适用边界的关键步骤与判断维度示意图

Trợ lý thanh bên: hiểu trang nhưng không thao tác trang

Dạng này gắn một thanh bên hoặc bảng điều khiển thường trực cạnh trình duyệt thông thường. Nó có thể tóm tắt bài viết dài, nghiên cứu học thuật và cả PDF hàng trăm trang; trả lời câu hỏi dựa trên trang bạn đang xem; viết email và báo cáo tuần; dịch hoặc viết lại nội dung; điều chỉnh giọng điệu và độ dài. Một số công cụ còn cho phép tải ảnh lên để phân tích hình ảnh hoặc trò chuyện trực tiếp bằng giọng nói.

Về bản chất, đây là việc đưa trợ lý AI đến ngay cạnh trang, loại bỏ bước sao chép và dán nội dung sang một cửa sổ chat khác. Với các việc như sắp xếp tài liệu, nghiên cứu chủ đề và hỗ trợ viết, dạng này thường đã đủ dùng.

Giới hạn cũng rất rõ: nó hiểu nội dung nhưng không vận hành website. Nó có thể giúp bạn hệ thống hóa nhiều tài liệu, nhưng không thể thay bạn nhấp, điền và gửi biểu mẫu. Đây là lớp đọc và xử lý, không phải lớp thực thi.

Trình duyệt do Agent điều khiển: tự thao tác được nhưng phù hợp với từng việc một

Dạng này tiến thêm một bước. Bạn giao nhiệm vụ bằng ngôn ngữ tự nhiên và Agent tự hoàn thành nhiều bước: cuộn trang, nhấp nút, điền biểu mẫu và so sánh thông tin giữa nhiều tab đang mở. Điểm cốt lõi là khả năng hiểu trang. Nó phải tự nhận ra đâu là ô nhập liệu và nút nào dùng để gửi, thay vì phụ thuộc vào selector được viết sẵn. Vì vậy, khi cấu trúc trang thay đổi và selector mất hiệu lực, nó vẫn có thể thử tiếp tục.

Có ba giới hạn chính. Các thao tác liên quan đến thanh toán, ngân hàng hoặc quyền riêng tư thường bị tạm dừng và yêu cầu xác nhận thủ công; đây là ranh giới an toàn được thiết kế chủ động, không phải lỗi. Trên các trang phức tạp hoặc site có nhiều thành phần tùy biến, nó vẫn dễ mắc sai sót. Một điểm thường bị bỏ qua là dạng này được thiết kế cho tương tác của một người dùng, không phải mức độ đồng thời cao, nên một nhiệm vụ tại một thời điểm là nhịp hoạt động bình thường.

Nó phù hợp cho cá nhân xử lý các nhiệm vụ web phức tạp nhưng không thường xuyên.

Cách ly trên đám mây: trình duyệt chạy từ xa nhưng trải nghiệm gần như cục bộ

Ở dạng này, tiến trình trình duyệt không chạy trên máy của bạn; thiết bị cục bộ chủ yếu phục vụ tương tác. Vì vậy, cùng một môi trường có thể được mở trên nhiều thiết bị, trong khi phiên làm việc và trạng thái đăng nhập được giữ trên đám mây, không cần thiết lập lại trên từng máy. Trạng thái có thể được chụp snapshot và rollback, môi trường gặp lỗi có thể quay về trạng thái khả dụng trước đó, và dữ liệu không cần nằm lại trên thiết bị cục bộ. Điều này hữu ích với nhóm dùng thiết bị không cố định hoặc không muốn phân tán dữ liệu kinh doanh trên nhiều endpoint.

Chi phí đánh đổi cũng đến từ đám mây. Việc truyền dữ liệu qua lại làm tăng độ trễ, nên cảm giác tương tác không nhanh như trình duyệt cục bộ. Khi số lượng môi trường tăng, chi phí tài nguyên đám mây cũng tiếp tục tăng. Khả năng truy cập tệp cục bộ, phần cứng cục bộ và hệ thống mạng nội bộ bị hạn chế hơn. Ngoài ra, đám mây chỉ thay đổi vị trí của máy; việc phân bổ network egress và kiểm soát mức đồng thời giữa nhiều môi trường vẫn phải được tự lên kế hoạch.

Trình duyệt có quản lý môi trường: lớp dành cho phần mềm điều phối

Dạng này không được định vị chủ yếu là trình duyệt cho con người, mà là tài nguyên môi trường để chương trình lập lịch và điều khiển.

Nó có thể tạo hàng loạt môi trường độc lập, mỗi môi trường có fingerprint, Cookie và bộ nhớ cục bộ riêng; cung cấp giao diện để tạo, truy vấn, khởi động, dừng và thu hồi môi trường; gắn network egress riêng cho từng môi trường; đồng thời tích hợp với các framework tự động hóa phổ biến để nhận điều khiển bằng chương trình. Mục tiêu là biến môi trường trình duyệt thành hạ tầng có thể lập lịch, cách ly và quản lý.

Nó giải quyết một loại vấn đề hoàn toàn khác. Khi nhiệm vụ tăng từ 1 lên 100, các cách trước có thể đồng loạt mất hiệu quả: một người dùng, một cửa sổ và từng nhiệm vụ một không chịu được xử lý theo lô; các môi trường ảnh hưởng lẫn nhau; các nhiệm vụ can thiệp nhau; và các tài khoản có thể bị coi là cùng một nhóm. Ở lớp này, PurpleMark cung cấp khả năng cách ly và quản lý tập trung các môi trường trình duyệt để mỗi nhiệm vụ chạy trong môi trường riêng.

Giới hạn là nó không quyết định thay bạn và cũng không thay đổi bất kỳ quy tắc nào của nền tảng. Một nhiệm vụ có tuân thủ hay không vẫn phụ thuộc vào chính nhiệm vụ đó.

Chọn như thế nào

Trình tự quyết định khá đơn giản: bắt đầu từ nhu cầu thực tế rồi suy ngược lại.

  • Nếu chỉ cần AI giúp hiểu trang web, dạng thứ nhất là đủ; không cần trả thêm cho khả năng thực thi không dùng đến.
  • Nếu cần AI thực hiện một thao tác phức tạp theo từng lần, dạng thứ hai phù hợp.
  • Nếu không muốn dữ liệu nằm cục bộ và cần tiếp tục công việc giữa nhiều thiết bị, dạng thứ ba phù hợp hơn.
  • Nếu cần các tác vụ tự động chạy ổn định, theo lô và không can thiệp nhau, thì dù dùng năng lực AI nào ở các lớp trên, bạn vẫn cần thêm lớp thứ tư.

Điểm cuối đáng nhấn mạnh. AI quyết định phải làm gì; môi trường trình duyệt quyết định hành động đó được thực hiện dưới danh tính nào. Khi lớp danh tính này không ổn định, lỗi có thể trông như ngẫu nhiên trong khi nguyên nhân gốc nằm ở môi trường. Nhiều nhóm ban đầu bị thu hút bởi khái niệm trình duyệt AI và mua công cụ thiên về hiểu nội dung, rồi sau đó mới phát hiện nhu cầu thật là thực thi theo lô. Nếu chọn sai hướng, công cụ tốt đến đâu cũng không bù được khoảng cách đó.

Trước hết hãy phân biệt bạn cần trợ lý hay cần khả năng thực thi, sau đó mới xác định quy mô. Trước khi mở rộng, hãy xây lớp môi trường và chạy thử quy trình với số lượng nhiệm vụ nhỏ. Tăng khối lượng sau đó sẽ dễ hơn nhiều so với việc xử lý một loạt tài khoản có liên hệ với nhau về sau.