Zurück zum Blog

Web-Scraping wird ständig blockiert: technische Grenzen und Compliance-Vorgaben

Ein lokal funktionierendes Scraping-Skript kann nach einiger Zeit online blockiert werden. Meist überlagern sich Signale wie Anfragefrequenz, Request-Merkmale und Rendering-Umgebung. Da Anti-Bot-Systeme laufend weiterentwickelt werden, ist es stabiler, robots-Regeln zu beachten, die Frequenz zu begrenzen und nur öffentliche Daten zu erfassen.

Ein Scraping-Skript kann lokal problemlos funktionieren und nach einiger Zeit im Online-Betrieb trotzdem ausfallen. Ein 403-Fehler, die Weiterleitung auf eine Prüfseite oder ein leeres HTML-Dokument haben meist dieselbe Ursache: Die Schutzsysteme der Website bewerten den Zugriff als untypisch für normale Nutzer.

网页采集频频被拦:技术边界与合规底线的关键步骤与判断维度示意图

Warum Scraping-Skripte nach und nach ausfallen

Anti-Bot-Schutz besteht nicht aus einer einzelnen Technik, sondern aus mehreren Erkennungsebenen. Häufig fällt zuerst die Frequenz auf: Dieselbe IP sendet in kurzer Zeit viele Anfragen an denselben Pfad, noch dazu in exakt gleichmäßigen Abständen. Dieses Muster ist besonders leicht zu erkennen. Nach einer Auslösung wird zunächst oft gedrosselt; bei stärkeren Auffälligkeiten wird die IP direkt gesperrt.

Die nächste Ebene betrifft die Identität. Ein Request nutzt etwa den Standard-User-Agent einer Skriptbibliothek, lässt typische Browser-Header aus oder behauptet, Chrome zu sein, ohne die passende JavaScript-Ausführungsumgebung und das entsprechende Rendering zu liefern. Solche Abweichungen fließen in die Bewertung ein. Websites hinter einem CDN können zusätzlich eine JavaScript-Challenge einsetzen: Zunächst wird Code ausgeliefert, der ausgeführt werden muss, bevor der eigentliche Inhalt erscheint. Eine reine HTTP-Bibliothek kann das Ergebnis nicht erzeugen und bleibt daher vor der Zugangsschranke.

Auch Verhaltensmerkmale sind deutlich erkennbar. Echte Nutzer laden Bilder und CSS, scrollen und machen Pausen. Ein Skript ruft dagegen oft nur HTML ab und beendet die Sitzung. Websites kombinieren diese Signale zu einer Bewertung; liegt sie unter einem Schwellenwert, erscheint ein CAPTCHA.

Diese Mechanismen entwickeln sich weiter. Ändert ein Schutzanbieter seine Erkennungslogik, müssen Skripte, die von festen Parametern und festen Intervallen leben, erneut angepasst werden. Je mehr Sonderparameter ergänzt werden, desto schwerfälliger wird das Skript, während glaubwürdiges Browser-Verhalten schwieriger nachzubilden ist. Die Annahme, ein einziges Skript könne auf allen Websites funktionieren, ist daher grundsätzlich unrealistisch.

Warum das Umgehen der Schutzmaßnahmen keine Option ist

Im Internet gibt es viele Anleitungen zum Umgehen von Schutzsystemen. Dabei handelt es sich jedoch nicht nur um eine technische Entscheidung, sondern möglicherweise um einen Verstoß gegen die Nutzungsbedingungen. Diese untersagen häufig ausdrücklich, Sicherheitsmaßnahmen und Zugriffsbeschränkungen zu umgehen. Was technisch machbar ist, ist deshalb nicht automatisch vertraglich oder rechtlich vertretbar.

Die Folgen sind konkret. Konten und IP-Adressen können unmittelbar gesperrt werden. In vielen Rechtsordnungen kann auch das Erlangen von Daten durch Umgehung technischer Schutzmaßnahmen rechtswidrig sein. Außerdem lassen sich Herkunft und Vollständigkeit solcher Daten schlechter nachvollziehen, was den Einsatz in nachgelagerten Entscheidungen riskanter macht. Ein technisches Problem in ein Compliance-Problem zu verwandeln, lohnt sich nicht.

Grundregeln für regelkonformes Scraping

Prüfen Sie zuerst die robots-Regeln und die Nutzungsbedingungen. In robots.txt steht, welche Pfade für Crawler freigegeben sind. Das ist nicht bloß ein unverbindlicher Hinweis, sondern die erklärte Präferenz des Website-Betreibers. Die Nutzungsbedingungen enthalten häufig weitere Vorgaben zur Datennutzung.

Gibt es eine offizielle API, sollte sie bevorzugt werden. Die Datenstruktur ist klar, Dokumentation und Quoten sind vorhanden, und eine Änderung des Frontends legt die Integration nicht komplett lahm. Reicht das Kontingent nicht aus, kann der Sammelplan reduziert oder über einen geschäftlichen Kontakt eine höhere Quote angefragt werden. Beides ist stabiler als das Umgehen von Beschränkungen.

Die Frequenz muss begrenzt werden. Erlaubtes Crawling bedeutet nicht, dass die gesamte Bandbreite ausgeschöpft werden darf. Pausen zwischen Anfragen, Limits pro Zeiteinheit und das Meiden von Spitzenzeiten verhindern viele Konflikte von vornherein.

Erfassen Sie nur öffentliche Daten und keine personenbezogenen Informationen. Inhalte, die eine Anmeldung erfordern, sowie ausdrücklich vom Crawling ausgeschlossene Daten sollten nicht gesammelt werden. Personenbezogene Daten sind rechtlich besonders geschützt; ihre Erhebung erfordert eine klare Rechtsgrundlage und gegebenenfalls die Einwilligung der Nutzer. Das ist keine technische Frage.

Was tun, wenn gerenderte Inhalte erforderlich sind?

Manche Seiten zeigen Inhalte erst nach der Ausführung von JavaScript. Eine reine Request-Bibliothek reicht dann nicht aus. Browser-Automatisierung kann die Seite öffnen und das gerenderte DOM auslesen, solange wichtige Grenzen eingehalten werden: in normalem Tempo zugreifen, nicht Dutzende Instanzen gleichzeitig gegen dieselbe Website starten und keine Automatisierung einsetzen, wenn die Website automatisierte Zugriffe ausdrücklich verbietet.

Eine Grenze wird dabei leicht verwechselt. Multi-Environment-Werkzeuge haben legitime Einsatzfälle, etwa mehrere rechtmäßige Konten getrennt zu halten, damit ein Team gleichzeitig die Backends verschiedener Kunden aufrufen kann. Sie sollten jedoch nicht dazu dienen, zahlreiche scheinbar unabhängige Nutzer vorzutäuschen, um dieselbe Website zu scrapen. Ersteres ist Kontoverwaltung, Letzteres die Umgehung von Zugriffsbeschränkungen.

Häufige Fragen

Ein Wechsel der IP verändert nur einen Teil der Bewertung. Bleiben Header, Frequenz und Fingerprint-Merkmale gleich, stößt das Skript schnell erneut auf dieselbe Barriere. Häufige IP-Wechsel können selbst als Anomalie auffallen.

Ist eine API-Quote klein, reduzieren Sie die Datenmenge entsprechend oder beantragen Sie über den geschäftlichen Kanal ein höheres Limit. Das ist oft kaum langsamer als eine Umgehung und hält die Datenquelle sauber und nachvollziehbar.

Öffentlich sichtbar bedeutet nicht automatisch frei nutzbar. Zusätzlich müssen die Nutzungsbedingungen, der urheberrechtliche Status der Daten und der spätere Verwendungszweck geprüft werden. Bei personenbezogenen Informationen ist besondere Vorsicht erforderlich.

Fazit

Wenn Scraping blockiert wird, hat die Website den Zugriff bereits als untypisch für normale Nutzer eingestuft. Praktisch bleiben zwei Wege: das Zugriffsverhalten wieder in einen normalen Rahmen bringen oder auf eine offizielle Schnittstelle wechseln. Das Umgehen von Schutzmaßnahmen wirkt wie eine Abkürzung, verschiebt das Risiko aber lediglich von der Technik zur Compliance.