Web scraping; pazar araştırması, ürün seçimi, SEO ve akademik araştırmalarda sık kullanılır. Bu rehber BeautifulSoup, Scrapy, Octoparse, ParseHub, Selenium, Playwright, Diffbot ve WebHarvy’yi teknik gereksinim ve kullanım senaryosuna göre karşılaştırır, ayrıca uygun veri toplama ilkelerini açıklar.
Sınır ötesi e-ticaret, pazar araştırması, ürün analizi, SEO veya akademik araştırma yapıyorsanız “web veri toplama” ile karşılaşmamanız neredeyse imkânsızdır: kararları desteklemek için herkese açık web sayfalarından fiyat, yorum, ürün bilgisi ve haber gibi yapılandırılmış verileri çıkarmak.
İnternette çok sayıda araç var; ancak yeni başlayanlar için asıl zor soru şudur: hangisini kullanmalısınız? Araçlar farklı türlere ayrılır. Bazıları yalnızca parsing yapar, bazıları tam crawler framework’üdür, bazıları kod yazmadan tıklamalarla çalışır, bazıları ise sayfaları otomatik yapılandırmak için AI kullanır. Bu rehber sekiz yaygın aracı yetenek düzeyine göre gruplar ve sonunda kendi durumunuza göre seçim yapmanızı sağlar.
1. Parsing ve temel kütüphaneler (biraz kod biliyorsanız)
BeautifulSoup. HTML/XML içinden veri çıkarmak için kullanılan bir Python web parsing kütüphanesidir. Genellikle önce Requests ile kaynak kod alınır, ardından BeautifulSoup ile analiz edilir. Ücretsiz ve open source (MIT).
- Avantajlar: öğrenmesi hızlı, sözdizimi basit, hatalı HTML’e toleranslı; küçük ölçekli ve özelleştirilmiş parsing işleri için uygundur.
- Sınırlamalar: yalnızca parsing yapar, tam bir crawler değildir, JavaScript render etmez ve çok büyük ölçekli toplamada zorlanır.
Scrapy. İstek planlama, parsing, deduplication ve depolamayı entegre eden tam bir Python crawling framework’üdür. Twisted tabanlı asenkron eşzamanlılık sayesinde yüksek performans sağlar. Ücretsiz ve open source (BSD).
- Avantajlar: büyük ve uzun süre istikrarlı çalışması gereken projeler için tek pakette yüksek performans.
- Sınırlamalar: framework mantığını öğrenmek zaman alır; dinamik JavaScript sayfaları için yine Selenium veya Playwright gerekir.
2. Görsel no-code araçlar (kod yazmadan)
Octoparse. Teknik olmayan kullanıcılar için görsel scraping aracıdır. Sayfadaki öğelere tıklayarak çıkarma kuralları oluşturabilirsiniz. Dahili tarayıcı dinamik yüklenen sayfaları işler; görevler bulutta çalıştırılabilir ve Excel/CSV/API’ye aktarılabilir.
- Fiyat: sınırlı ücretsiz plan; Standard yaklaşık $69/ay, Professional yaklaşık $249/ay.
- Uygun olduğu durum: programlama geçmişi olmayan ve hızlıca görev kurmak isteyen kullanıcılar.
ParseHub. Statik ve dinamik sayfaları, bulut görevlerini, zamanlanmış scraping’i ve API çıktısını destekleyen başka bir görsel no-code scraper’dır.
- Fiyat: ücretsiz plan yaklaşık 200 sayfayla sınırlı; Standard yaklaşık $189/ay, Professional yaklaşık $599/aydan başlar.
- Uygun olduğu durum: zamanlanmış görevleri bulutta çalıştırmak isteyen teknik olmayan ekipler.
WebHarvy. Listeleri, tabloları ve sayfalamayı otomatik tanıyan, toplu veri çıkarma ve dışa aktarma yapabilen, zamanlanmış görevleri destekleyen görsel scraper’dır.
- Fiyat: tek seferlik lisans (bir kullanıcı için yaklaşık $129), abonelik yenilemesi gerekmez.
- Uygun olduğu durum: aylık abonelik yerine kalıcı lisans isteyen bireysel kullanıcılar.
3. Tarayıcı otomasyonu (dinamik sayfalar için)
Selenium. Tarayıcıyı programla kontrol ederek sayfa yükleme, tıklama, kaydırma ve form doldurma işlemleri yapabilen köklü bir tarayıcı otomasyon aracıdır. JavaScript ile dinamik render edilen içerikleri toplamak için uygundur ve birden fazla tarayıcı ile dili destekler. Ücretsiz ve open source (Apache-2.0).
- Avantajlar: neredeyse her sayfayla etkileşime girebilir.
- Sınırlamalar: gerçek tarayıcı başlatması gerektiği için daha yavaş ve kaynak tüketimi daha yüksektir; aşırı büyük ölçek için ideal değildir.
Playwright. Microsoft’un Chromium, Firefox ve WebKit’i destekleyen modern tarayıcı otomasyon framework’üdür. Headless mod ve akıllı bekleme özellikleri sayesinde SPA’lar ve karmaşık dinamik sayfalarda genellikle daha kararlıdır. Ücretsiz ve open source (Apache-2.0).
- Uygun olduğu durum: JavaScript render’a yoğun şekilde bağlı modern siteler.
4. AI ile yapılandırılmış API’ler (crawler bakımı istemeyen enterprise kullanım)
Diffbot. Sabit seçicilere bağlı kalmadan çalışan, AI tabanlı web veri yapılandırma servisidir. Makale, ürün ve yorum gibi sayfa türlerini otomatik tanır ve REST API üzerinden yapılandırılmış JSON döndürür. Sayfa düzeni değiştiğinde kuralları sürekli elle güncellemek çoğu zaman gerekmez.
- Fiyat: ayda 10k credits ücretsiz; Startup $299/ay; Plus $899/ay; özel Enterprise planları.
- Uygun olduğu durum: kendi crawler altyapısını bakımda tutmadan uzun vadede kararlı ve kaliteli yapılandırılmış veri isteyen işletmeler.
Peki hangisini seçmelisiniz?

Durumunuzu şu ölçütlerle eşleştirin:
- Kod yazabiliyor ve yüksek hacimde veri topluyorsanız: ana framework olarak Scrapy, ayrıntılı parsing için BeautifulSoup kullanın.
- Sayfa içeriği JavaScript ile dinamik yükleniyorsa: render ve veri çıkarma için Selenium veya Playwright ekleyin.
- Kod yazmıyor ve hızlı başlamak istiyorsanız: ücretsiz plan, abonelik veya tek seferlik lisans tercihine göre Octoparse, ParseHub ya da WebHarvy seçin.
- Enterprise düzeyinde temiz yapılandırılmış veri gerekiyorsa: bakım maliyetini azaltmak için Diffbot gibi bir AI API kullanın.
- Sadece ara sıra az miktarda veri topluyorsanız: BeautifulSoup + Requests genellikle yeterlidir; gerekmedikçe ağır bir framework ile başlamayın.
Uyumluluk ve istikrar için üç temel ilke
Doğru aracı seçmek işin yalnızca yarısıdır. Aşağıdaki ilkeler veri toplama sürecinin uzun vadede kararlı ve uygun şekilde çalışıp çalışamayacağını doğrudan etkiler:
1. Yalnızca erişim hakkınız olan herkese açık verileri toplayın. Hedef sitenin robots kurallarına ve hizmet şartlarına saygı gösterin. Herkese açık olmaması gereken verileri elde etmek için giriş duvarlarını, CAPTCHA’ları veya erişim kontrollerini aşmaya çalışmayın. Toplamanın uygunluğu, bilginin gerçekten açık olup olmadığına ve onu kullanma hakkınıza bağlıdır.
2. Erişim sıklığını kontrol edin ve siteleri aşırı yüklemeyin. Çok sık veya yüksek eşzamanlı istekler sitenin normal hizmetini bozabilir ve kısıtlamalara yol açabilir. Her şeyi tek seferde çekmek yerine sıklığı düşürmek, makul gecikmeler eklemek ve veriyi partiler halinde toplamak daha doğrudur.
3. Hesap ve oturum kullanılan işlerde ortamları izole edin. Bir görev, oturumun korunması gereken panellere veya üye sayfalarına giriş yapıyorsa PurpleMark gibi bir araçla her proje ya da müşteri için ayrı tarayıcı ortamı oluşturabilir, Cookies, giriş durumları ve proxy’leri ayrı tutabilirsiniz. Böylece farklı görevlerin oturumları birbirine karışmaz ve bir görevdeki temizlik veya hata diğer ortamları daha az etkiler. Proje bazlı arşivleme ve sorun giderme de daha anlaşılır olur. Araç yürütme ortamını düzenli tutar; topladığınız verinin açık ve uygun olup olmadığını değerlendirme sorumluluğu yine sizdedir.
Sık sorulan sorular
BeautifulSoup mı Scrapy mi kullanmalıyım? BeautifulSoup bir parsing kütüphanesidir, Scrapy ise tam bir crawling framework’üdür. Az veri için BeautifulSoup; büyük ve uzun süreli işler için Scrapy kullanın. İkisi sıkça birlikte de kullanılır.
Kod bilmeden web verisi toplanabilir mi? Evet. Octoparse, ParseHub ve WebHarvy gibi no-code araçlar, görsel tıklamalarla scraping görevleri oluşturmanızı sağlar ve teknik olmayan kullanıcılar için uygundur.
Selenium ile Playwright arasında nasıl seçim yapılır? İkisi de JavaScript ağırlıklı dinamik sayfaları işler. Playwright daha yeni, çoğu zaman daha hızlıdır ve farklı tarayıcı motorlarını iyi destekler; modern siteler için uygundur. Selenium daha köklüdür, eğitim materyali daha fazladır ve ekosistemi olgundur. Tercihiniz ve mevcut kod stack’iniz seçimi belirleyebilir.
Dinamik render edilen sayfalarda mutlaka tarayıcı aracı gerekir mi? Her zaman değil. Önce verinin ilk HTML içinde bulunup bulunmadığını kontrol edin. Veri Ajax ile asenkron yükleniyorsa alttaki API’yi analiz etmek daha uygun olabilir. Selenium/Playwright yalnızca tam tarayıcı render’ı gerçekten gerektiğinde kullanılmalıdır.
PurpleMark ile veri toplamak uygun mudur? PurpleMark, farklı toplama görevlerinin oturumlarını, proxy’lerini ve giriş durumlarını izole etmek için kullanılan bir tarayıcı ortam yönetim aracıdır. Veri toplamanın uygunluğu, erişim hakkınız olan açık verileri toplayıp toplamadığınıza ve hedef sitenin şartlarına uyup uymadığınıza bağlıdır. Bu kullanım şekliyle ilgilidir; aracın kendisi nötrdür.
Sonuç
Web scraping aracı seçmek temelde teknik geçmişiniz + veri hacmi + sayfa türü eşleşmesidir: kod yazıyorsanız BeautifulSoup/Scrapy, no-code için Octoparse/ParseHub/WebHarvy, dinamik sayfalar için Selenium/Playwright, enterprise yapılandırılmış veri için Diffbot. Aracı seçtikten sonra açık veri, kontrollü istek sıklığı ve ortam izolasyonu ilkelerine bağlı kalırsanız projeniz uzun vadede daha kararlı ve uygun şekilde çalışabilir.
(Uyumluluk notu: yalnızca erişim hakkınız olan herkese açık verileri toplayın ve hedef sitenin robots kuralları ile hizmet şartlarına uyun.)


