Bloga dön

AI web otomasyonu nedir? AI web sayfalarını nasıl kullanır ve nasıl uygulanır?

AI web otomasyonu, sistemlerin sayfa anlamını kavrayıp tıklama, form doldurma ve gezinme işlemlerini bağımsız yapmasını sağlar. Bu yazı algılama → akıl yürütme → eylem döngüsünü açıklar; Selenium, Playwright, Computer Use ve AI Agent yaklaşımlarını ve uygulama zorluklarını karşılaştırır.

Büyük dil modellerinin yetenekleri arttıkça “AI’ın web sayfalarını bir insan gibi kullanması” fikri kavram olmaktan çıkıp pratik uygulamaya dönüşüyor. AI artık sayfa içeriğini anlayabiliyor ve form doldurma, veri toplama, yönetim panellerini sürdürme ve giriş gerektiren pazarlama görevlerini yürütme gibi nispeten karmaşık işleri tamamlayabiliyor. Bu makale, AI web otomasyonunun çalışma prensibini, başlıca uygulama yöntemlerini ve sahada karşılaşılabilecek zorlukları açıklayarak çözüm seçmeden önce sağlam bir değerlendirme çerçevesi oluşturmanıza yardımcı olur.

AI web otomasyonu nedir?

AI web otomasyonu (AI Web Automation), yapay zekâ kullanarak bir sistemin web sayfasının yapısını bağımsız biçimde anlamasını, sayfa öğelerini tanımasını, tıklama, yazma, kaydırma ve gezinme gibi işlemleri gerçekleştirmesini ve sayfadaki değişikliklere göre yürütme stratejisini dinamik biçimde ayarlayarak otomasyon görevini tamamlamasını ifade eder.

Bu yaklaşım, AI entegrasyonu olmayan yerel Selenium veya Puppeteer scriptleri gibi sabit kurallı geleneksel otomasyondan oldukça farklıdır. Geleneksel çözümde geliştiriciler sayfayı önceden analiz eder, XPath veya CSS Selector gibi kesin öğe konumlandırıcılarını koda sabitler ve katı, doğrusal adımlar tanımlar. Yapısı stabil ve seyrek güncellenen sistemlerde iyi çalışsa da sık değişen herkese açık sitelerde sorunları hızla ortaya çıkar.

Geleneksel web otomasyonu neden bu kadar kolay “bozulur”?

Sabit kurallı scriptlerin aşılması zor birkaç eksisi vardır:

  • Sayfa tasarımı değişince script hemen geçersiz olabilir: E-ticaret ve sosyal medya platformları frontendlerini çok sık günceller. UI değiştiğinde, framework refactor edildiğinde veya dinamik obfuscation eklendiğinde öğe ID’leri, sınıf adları ve buton konumları değişebilir. Script önceden tanımlı hedefi bulamazsa kesilir; geliştiricilerin öğeyi yeniden bulup kodu değiştirmesi gerekir ve bakım maliyeti yükselir.
  • Sayfanın anlamını kavrayamaz: Script <div> veya <button> gibi kod yapılarını tanır, ancak “sipariş sayfası” ya da “verileri indir” ifadelerinin ne anlama geldiğini bilmez. Bir insan “giriş yaptıktan sonra sipariş sayfasına git ve bu ayın satış verilerini indir” diyebilir; geleneksel script ise yalnızca sabit URL’leri ve selector’ları izler. Araya giren tek bir tanıtım popup’ı bile akışı bozabilir.
  • İstisnalarla baş etmek zordur: Pazarlama popup’ları, Cookie izinleri, CAPTCHA ve yükleme gecikmeleri akışları sık sık keser. Beklenmedik bir katman butonu kapattığında script hata verebilir; AI ise önce “popup butonu kapatıyor” diye değerlendirip onu kapatabilir ve ardından ana göreve devam edebilir.

AI’ın değeri, sabit kuralları mekanik biçimde uygulamak yerine niyeti anlaması ve dinamik karar verebilmesidir.

AI’ın web sayfalarını kullanmasının temel prensibi

AI’ın bir web sayfasıyla etkileşimi özünde Algılama (Perception) → Akıl Yürütme (Reasoning) → Eylem (Action) şeklinde bir kontrol döngüsüdür.

  • Algılama katmanı: Web sayfasını AI’ın anlayabileceği veriye dönüştürür. AI bir web sayfasını insanın görsel olarak algıladığı biçimde doğrudan okuyamaz; bu nedenle önce yapılandırılmış girdiye dönüştürmek gerekir. İki yaygın yöntem vardır: DOM ağacı temizleme ve semantik analiz; burada DOM alınır, gereksiz CSS/JS çıkarılır ve modele yalnızca metin ile etkileşimli öğeler gönderilir. Diğer yöntem multimodal görsel tanımadır; render edilmiş ekran görüntüsü alınır ve vision model hedefleri ve etkileşim bölgelerini tespit eder.
  • Karar katmanı: Bağlama göre adımları çıkarır. Bir AI Agent yapılandırılmış sayfa verisini ve nihai hedefi aldığında önce mevcut durumu belirler — giriş yapılmış mı, bir CAPTCHA akışı engelliyor mu, doğru sonuç sayfasında mı — ardından hedefi sıralı atomik eylemlere böler; örneğin arama kutusuna odaklanmak, anahtar kelimeyi yazmak ve gönderimi tetiklemek.
  • Yürütme katmanı: Tarayıcıyı gerçek işlemleri yapacak şekilde sürer. Modelin genellikle JSON veya metin talimatları olarak ürettiği kararlar, Chrome DevTools Protocol (CDP) gibi standart tarayıcı sürüş protokollerine çağrıya dönüştürülür ve tarayıcı gerçekten tıklama, yazma ve diğer işlemleri yapar.

Algılama, akıl yürütme ve eylemden doğrulama ve uyarlamaya uzanan AI web otomasyonu döngüsü

Dört ana uygulama yöntemi arasından nasıl seçim yapılır?

AI web otomasyonunun farklı uygulama yolları vardır ve her birinin kendine özgü dengeleri bulunur.

YöntemYaklaşımAvantajlarSınırlamalarUygun senaryolar
Selenium + AI geliştirmeGeleneksel framework iskelet, LLM beyin; dinamik öğelerde API çağrısıOlgun ekosistem, geniş tarayıcı desteğiWebDriver SPA’larda nispeten yavaş olabilirKurum içi formlar, geleneksel web veri toplama
Playwright + AIPlaywright temel motor, CDP üzerinden çift yönlü iletişimHızlı, güçlü eşzamanlılık, gelişmiş dinamik beklemeÇok eski intranet tarayıcılarında uyumluluk zayıfYüksek frekanslı operasyon otomasyonu, eşzamanlı çoklu görev
Computer Use görsel moduEkran görüntüsünü okuyup piksel koordinatlarına göre tıklarFrontend koduna daha az bağımlı, güçlü genellemeYüksek token ve maliyet, daha fazla gecikmeKodu yoğun biçimde obfuscate edilmiş kapalı platformlar
AI Agent + entegre frameworkOtonom “gözlemle-düşün-harekete geç-doğrula” döngüsüYazılımlar arasında çalışabilir, en kapsamlı yetenekYüksek mühendislik karmaşıklığıKarmaşık uçtan uca iş süreçleri

Gerçek projelerde seçim genellikle sayfa stabilitesi, giriş gereksinimi, bütçe ve gecikme toleransına göre yapılır. Basit ve stabil sayfalarda Selenium + AI yeterli olabilir; hız ve eşzamanlılık öncelikliyse Playwright uygundur; sayfa çok karmaşıksa ve kod uyarlanamıyorsa görsel mod veya tam AI Agent framework daha mantıklıdır.

Uygulamada karşılaşılacak zorluklar

AI “daha akıllı” olsa bile ölçekli kullanım hâlâ iki önemli kısıta sahiptir:

  • Dinamik CAPTCHA ve insan doğrulaması: reCAPTCHA, Cloudflare Turnstile, GeeTest ve benzeri sistemler cihaz ortamını, davranış izlerini ve ağ gecikmesini analiz eder. AI “doğrulama gerekiyor” ifadesini anlayabilir; ancak karmaşık yapbozlar veya mekânsal akıl yürütme CAPTCHA’ları yüksek hesaplama gücü ya da uzman decode servisleri gerektirebilir.
  • Browser fingerprinting: Risk kontrol sistemleri yalnızca davranışın “insana benzeyip benzemediğini” değerlendirmez; JavaScript ile Canvas render, WebGL GPU yapılandırması, AudioContext, font listesi, UA, sistem saat dilimi ve dil gibi donanım ve ortam özelliklerini de algılayabilir. AI hedef siteye bir otomasyon framework’ünün varsayılan ortamından erişirse fingerprintler aşırı benzer olabilir ve araç izleri belirginleşebilir; bu da bot olarak sınıflandırılmayı ve slider ya da erişim kısıtlarının tetiklenmesini kolaylaştırır.

Stabil kullanım için ortam da doğru olmalı

Yukarıdaki iki zorluktan CAPTCHA daha çok tanıma yeteneğini test ederken, “fingerprint benzerliği ve ortam kararsızlığı” temelde çalışma ortamı sorunlarıdır. Birçok ekip, model ne kadar güçlü olursa olsun scriptlerin tutarsız parametrelere sahip ve ağ çıkışı sürekli değişen bir tarayıcıda çalışması hâlinde giriş sorunları ve kesilen görevlerin devam ettiğini görür.

Daha stabil yaklaşım, “yürütme ortamı” ile “AI karar mekanizmasını” ayrı yönetmektir. Farklı görevler için tutarlı parametrelere sahip tarayıcı ortamları hazırlayın — işletim sistemi, UA, dil, saat dilimi, çözünürlük ve ağ çıkışı sabit kalsın — ardından AI scriptlerinin bir arayüz üzerinden bu ortamlara bağlanmasını sağlayın. Böylece AI’ın semantik anlama ve dinamik karar verme avantajı korunurken her çalıştırma tutarlı ve kontrol edilebilir bir ortamda gerçekleşir; çevresel dalgalanmalardan kaynaklanan başarısızlıklar ve tekrarlı doğrulamalar azalır. PurpleMark bu yönde bir uygulama yolu sunar: web çalışma alanında göreve göre tarayıcı ortamları oluşturulup yönetilebilir ve Puppeteer, Playwright veya AI araçları Local API üzerinden bu ortamlara bağlanabilir. PurpleMark Skill ayrıca ortam yönetimi yeteneklerini Claude Code, Codex, Cursor ve OpenClaw gibi AI araçlarına bağlayarak AI’ın stabil bir tarayıcı ortamında görevlerini tamamlamasını sağlar.

Uyumluluk notu: AI web otomasyonunu kurallara uygun veri toplama, test ve kendi iş operasyonlarınız için kullanın. Hedef sitenin şartlarına ve robots kurallarına uyun; otomasyonu toplu hesap kaydı, sahtecilik veya platform güvenlik incelemelerini aşmak için kullanmayın.

Sık sorulan sorular

AI web otomasyonu geleneksel RPA’nın yerini tamamen alabilir mi? Hayır. Yapısı stabil iç sistemlerde RPA daha basit ve güvenilirdir; sık değişen ve semantik anlayış gerektiren herkese açık web görevlerinde AI otomasyonu daha avantajlıdır. İki yaklaşım çoğu zaman birbirini tamamlar.

Görsel mod her zaman en iyi seçenek mi? Genelleme yeteneği en güçlüdür, ancak maliyeti ve gecikmesi de en yüksektir. Çoğu projede DOM seviyesindeki yaklaşım yeterlidir; görsel mod genellikle kod yoğun biçimde obfuscate edilmişse veya gerçekten ekranda görülen üzerinden işlem yapmak gerekiyorsa anlamlıdır.

Kod doğru görünse bile script neden başarısız olur? Başarısızlıkların önemli bir kısmı çalışma ortamından kaynaklanır: benzer fingerprintler, kararsız ağ çıkışı veya kaybolan login oturumları. Scripti tutarlı parametrelere ve stabil çıkışa sahip bir tarayıcı ortamında çalıştırmak, kodu sürekli yeniden ayarlamaktan çoğu zaman daha etkilidir.

AI otomasyonu pahalı mı? Moda göre değişir. DOM seviyesindeki çözümler daha az token tüketir ve daha düşük maliyetlidir; tamamen görsel Computer Use ise analiz için tekrar tekrar ekran görüntüsü yüklediğinden belirgin biçimde daha pahalıdır. Mimari seçimde bütçe hesaba katılmalıdır.