Bij internationaal marktonderzoek loopt dataverzameling vaak halverwege vast. Door technische grenzen en compliancegrenzen apart te bekijken, kun je de benodigde informatie verzamelen zonder regels te overschrijden; vier praktische principes bieden houvast.
Bij internationaal marktonderzoek is het echte probleem meestal niet dat er helemaal geen data te verzamelen zijn, maar dat de toegang op een bepaald punt plotseling stopt. Hetzelfde script dat vorige week nog werkte, kan deze week een lege pagina teruggeven, en steeds verder bijstellen maakt het soms juist minder stabiel.
Maak daarom eerst onderscheid tussen twee soorten obstakels: gaat het om een technische grens of om een compliancegrens? De aanpak is volledig anders. Technische grenzen kunnen soms met engineering worden verbeterd; bij compliancegrenzen moet je een andere route kiezen.

Technische grenzen: de tegenmaatregelen blijven zich ontwikkelen
Anti-crawling is geen vaste muur. Frequentielimieten, controle van het bron-IP, gedragsanalyse en fingerprintdetectie worden afgewisseld, terwijl websites ook geregeld hun HTML-structuur en stijlen aanpassen. Parsers op basis van vaste regels kunnen daardoor op elk moment uitvallen. Wie crawlers bouwt, kent dit: de meeste tijd gaat vaak niet naar het ophalen van data, maar naar het steeds opnieuw repareren van scripts na veranderingen aan de andere kant.
Dynamische rendering brengt extra kosten mee. Steeds meer belangrijke content wordt asynchroon via JS geladen en is met statische analyse niet zichtbaar. Dan moet een headless browser de pagina echt uitvoeren om het resultaat te krijgen. Dat kan, maar kost meer rekenkracht, bandbreedte en tijd en verlaagt de snelheid.
De kosten van gedragsverificatie zijn minder zichtbaar. Verzoeken moeten eruitzien als handelingen van een echte gebruiker, waardoor het verzameltempo omlaag moet, de paralleliteit moet worden beperkt en de taakduur onvoorspelbaarder wordt. Ook moet ruimte blijven voor handmatige controle. Verwachten dat dit tegelijk snel en stabiel is, is niet realistisch.
Een ander vaak gemist punt is contentpersonalisatie. Dezelfde pagina kan bezoekers uit verschillende regio’s, talen of apparaattypen andere feeds, zoekresultaten of zelfs prijzen tonen. Voor volledige dekking moet de verzameling het perspectief van echte gebruikers in de doelmarkt nabootsen, wat extra engineeringwerk oplevert.
Compliancegrenzen: lijnen die niet mogen verschuiven
- robots-regels: Respecteer het gebied dat een site voor crawling beschikbaar stelt. Dat is een basisvoorwaarde, geen optie.
- Gebruiksvoorwaarden: Veel platforms verbieden geautomatiseerde dataverzameling expliciet. Overtreding kan leiden tot accountbeperkingen en zelfs juridisch risico.
- Datarechten: Dat content kan worden verzameld, betekent niet dat die vrij mag worden gebruikt. Bij auteursrecht of databankrechten is extra voorzichtigheid nodig.
- Frequentielimieten: Ook zonder expliciet verbod moet je paralleliteit en intervallen beperken om de dienst niet te overbelasten.
CAPTCHA’s en menselijke verificatie verdienen aparte aandacht. Ze geven expliciet aan dat het platform geautomatiseerde toegang niet accepteert. Als je ze behandelt als technische obstakels die moeten worden overwonnen, verandert de aard van de activiteit.
Vier principes voor conforme dataverzameling
- Verzamel alleen openbare data: Content die login of toestemming vereist, is niet openbaar.
- Beperk de frequentie: Voeg redelijke vertragingen toe, beperk paralleliteit en houd het aantal verzoeken op een niveau dat de andere dienst aankan.
- Verzamel geen persoonsgegevens: Vermijd namen, telefoonnummers, e-mailadressen, adressen en vergelijkbare velden.
- Volg de regels van de site: Vermijd paden die volgens robots-regels of gebruiksvoorwaarden verboden zijn.
In de praktijk kunnen de meeste teams die internationaal uitbreiden het grootste deel van hun onderzoek uitvoeren met officiële API’s en openbare datasets, zoals sectorrapporten, open-dataplatforms en academische datasets. Frequentielimieten en autorisatiescopes staan in de API-documentatie, waardoor dit de eenvoudigste route is. Voor grotere volumes of specialistischere behoeften kun je betaalde datadiensten of geautoriseerde samenwerking met data-eigenaren overwegen. Bij kleine steekproeven is handmatige verzameling vaak goedkoper dan langdurig onderhoud van een crawler.
Een herbruikbare beslisvraag
Bij een obstakel kun je jezelf één vraag stellen: als het platform wist wat ik doe, zou het mij dan een interface geven of mijn account blokkeren?
In het eerste geval gaat het om een normale zakelijke relatie; zoek dan naar de officiële interface. In het tweede geval is de route zelf niet toegestaan en moet je van route veranderen, niet alleen van hulpmiddel.
Omgevingsbeheer wanneer meerdere accounts het werk verdelen
Sommige onderzoeken vereisen echt aparte accounts per regio of categorie, bijvoorbeeld om zoekresultaten en prijzen tussen markten afzonderlijk te vergelijken. Het doel is niet om handelingen verborgen te maken, maar om elk account een onafhankelijke en stabiele omgeving te geven zodat beperkingen van één account niet doorwerken naar andere accounts. In zo’n scenario kan PurpleMark voor verschillende onderzoeksaccounts afzonderlijke browseromgevingen maken en die koppelen aan netwerkuitgangen in de betreffende regio’s, zodat dit een vaste routine wordt.
Omgekeerd geldt: verander een eenmaal ingestelde omgeving niet te vaak. Vandaag de netwerkuitgang wijzigen en morgen de parameters kan er voor het platform uitzien alsof een account voortdurend van apparaat wisselt; dat signaal alleen kan al verdacht zijn.
Conclusie
Problemen met frequentie, IP en fingerprints kunnen met engineering worden verbeterd; CAPTCHA’s en menselijke verificatie zijn regelgrenzen die niet moeten worden omzeild. Door databronnen uit te breiden van alleen crawling naar officiële API’s, openbare datasets, betaalde diensten en geautoriseerde samenwerking wordt onderzoek vaak stabieler.


