Zurück zum Blog

Technische und rechtliche Grenzen beim Crawling: Vier Prinzipien für die Datenerhebung

Bei internationaler Marktforschung wird die Datenerhebung oft mitten im Prozess blockiert. Wer technische Grenzen von Compliance-Grenzen trennt, kann benötigte Informationen beschaffen, ohne Regeln zu überschreiten; vier praxisnahe Prinzipien helfen dabei.

Bei internationaler Marktforschung besteht das eigentliche Problem meist nicht darin, gar keine Daten zu bekommen, sondern darin, dass der Zugriff ab einem bestimmten Punkt plötzlich endet. Dasselbe Skript, das letzte Woche noch lief, kann diese Woche nur eine leere Seite zurückgeben; weiteres Nachjustieren macht es oft noch instabiler.

Zuerst sollte man daher klären, ob das aktuelle Hindernis eine technische Grenze oder eine Compliance-Grenze ist. Die Reaktion darauf ist grundverschieden: Technische Grenzen lassen sich teilweise mit Engineering-Aufwand verbessern, bei Compliance-Grenzen muss dagegen der Weg geändert werden.

爬虫的技术边界与合规边界:四条采集原则的关键步骤与判断维度示意图

Technische Grenzen: Die Gegenmaßnahmen entwickeln sich ständig weiter

Anti-Crawling-Maßnahmen sind keine feste Mauer. Ratenbegrenzungen, Prüfungen der Quell-IP, Verhaltensanalysen und Fingerprint-Erkennung wechseln sich ab; zusätzlich ändern Websites gelegentlich HTML-Struktur und Styles. Parser mit starren Regeln können daher jederzeit ausfallen. Wer Crawler entwickelt, kennt das: Am meisten Zeit kostet oft nicht das Auslesen der Daten, sondern das wiederholte Anpassen an Änderungen der Gegenseite.

Dynamisches Rendering verursacht weitere Kosten. Immer mehr wichtige Inhalte werden asynchron per JS geladen und sind mit statischer Analyse nicht sichtbar. Dann muss ein Headless-Browser die Seite tatsächlich ausführen, bevor die Inhalte verfügbar sind. Das ist möglich, erhöht aber Maschinen-, Bandbreiten- und Zeitaufwand und verlangsamt den Prozess.

Noch weniger sichtbar sind die Kosten von Verhaltensprüfungen. Anfragen sollen wie echte Nutzeraktionen wirken, deshalb muss die Abfragefrequenz sinken, die Parallelität begrenzt werden und die Laufzeit wird schwer planbar. Zusätzlich muss Zeit für manuelle Kontrolle eingeplant werden. Gleichzeitig hohe Geschwindigkeit und hohe Stabilität zu erwarten, ist unrealistisch.

Leicht übersehen wird außerdem die Personalisierung von Inhalten. Dieselbe Seite kann je nach Region, Sprache oder Gerätetyp unterschiedliche Feeds, Suchergebnisse oder sogar Preise zeigen. Für eine vollständige Abdeckung muss die Datenerhebung die Perspektive realer Nutzer im Zielmarkt nachbilden, was zusätzlichen Engineering-Aufwand bedeutet.

Compliance-Grenzen: Linien, die nicht aufgeweicht werden dürfen

  • robots-Regeln: Den von der Website freigegebenen Crawl-Bereich zu respektieren ist eine Mindestanforderung, keine Option.
  • Nutzungsbedingungen: Viele Plattformen untersagen automatisierte Datenerhebung ausdrücklich. Verstöße können Kontobeschränkungen oder rechtliche Risiken nach sich ziehen.
  • Datenrechte: Dass Inhalte erfasst werden können, bedeutet nicht, dass sie beliebig genutzt werden dürfen. Bei urheberrechtlich geschützten Inhalten oder Datenbankrechten ist besondere Vorsicht nötig.
  • Ratenbegrenzung: Auch ohne ausdrückliches Verbot sollten Parallelität und Intervalle so gesteuert werden, dass der Dienst nicht überlastet wird.

CAPTCHAs und Mensch-Maschine-Prüfungen sind gesondert zu behandeln. Sie zeigen ausdrücklich, dass die Plattform automatisierten Zugriff nicht akzeptiert. Werden sie als rein technisches Hindernis betrachtet, das überwunden werden soll, ändert sich der Charakter des Vorgehens.

Vier Prinzipien für regelkonforme Datenerhebung

  1. Nur öffentliche Daten erfassen: Inhalte, die Login oder Autorisierung erfordern, gehören nicht zum öffentlichen Bereich.
  2. Frequenz steuern: Angemessene Pausen einbauen, Parallelität begrenzen und das Anfragevolumen auf ein für den Dienst tragbares Niveau reduzieren.
  3. Keine personenbezogenen Daten erfassen: Namen, Telefonnummern, E-Mail-Adressen, Anschriften und ähnliche Felder nicht sammeln.
  4. Vorgaben der Website beachten: Pfade meiden, die durch robots-Regeln oder Nutzungsbedingungen ausgeschlossen sind.

In der Praxis können die meisten international arbeitenden Teams einen großen Teil ihrer Recherche mit offiziellen APIs und öffentlichen Datensätzen abdecken, etwa Branchenberichten, Open-Data-Plattformen und wissenschaftlichen Datensätzen. Frequenz- und Berechtigungsgrenzen stehen in der API-Dokumentation und sind damit am einfachsten planbar. Für größere oder speziellere Datenmengen kommen bezahlte Datendienste oder autorisierte Kooperationen mit Dateninhabern infrage. Bei kleinen Stichproben ist manuelle Aufbereitung oft günstiger als die langfristige Wartung eines Crawlers.

Eine wiederverwendbare Entscheidungsfrage

Bei einem Hindernis hilft eine einfache Frage: Wenn die Plattform wüsste, was ich tue, würde sie mir eine Schnittstelle geben oder mein Konto sperren?

Im ersten Fall handelt es sich um eine normale geschäftliche Beziehung; dann sollte man die offizielle Schnittstelle suchen. Im zweiten Fall ist der Weg selbst nicht erlaubt, also sollte man den Weg wechseln und nicht nur das Werkzeug.

Umgebungsmanagement bei mehreren Konten

Manche Recherchen erfordern tatsächlich getrennte Konten nach Region oder Kategorie, etwa um Suchergebnisse und Preise verschiedener Märkte separat zu vergleichen. Entscheidend ist nicht, Aktivitäten zu verbergen, sondern jedem Konto eine eigene stabile Umgebung zu geben, damit Einschränkungen eines Kontos nicht auf andere übergreifen. In solchen Fällen kann PurpleMark für verschiedene Recherchekonten separate Browserumgebungen anlegen und jeweils einen Netzausgang der passenden Region zuordnen, sodass dieser Schritt zu einem festen Arbeitsablauf wird.

Umgekehrt gilt: Ist eine Umgebung eingerichtet, sollte sie nicht häufig geändert werden. Heute den Netzausgang und morgen Parameter zu wechseln, kann aus Sicht der Plattform wie ein ständiger Gerätewechsel aussehen; schon dieses Signal kann verdächtig wirken.

Fazit

Probleme mit Frequenz, IP und Fingerprints lassen sich mit technischen Maßnahmen verbessern; CAPTCHAs und Mensch-Maschine-Prüfungen sind dagegen Regelgrenzen, die nicht umgangen werden sollten. Wer Datenquellen um offizielle APIs, öffentliche Datensätze, bezahlte Dienste und autorisierte Kooperationen erweitert, erhält häufig einen stabileren Rechercheprozess.