해외 시장 조사에서는 데이터 수집이 중간에 막히는 일이 흔합니다. 기술적 한계와 컴플라이언스 한계를 분리해서 보면 필요한 정보를 규칙을 넘지 않고 확보하기 쉬워집니다. 실무에 적용할 수 있는 네 가지 원칙을 정리합니다.
해외 시장 조사를 할 때 실제로 발목을 잡는 문제는 데이터를 전혀 얻지 못하는 것이 아니라, 어느 지점까지는 되다가 갑자기 더 이상 들어갈 수 없게 되는 경우가 많습니다. 지난주까지 잘 돌던 같은 스크립트가 이번 주에는 빈 페이지를 반환하고, 계속 조정할수록 오히려 더 불안정해질 수도 있습니다.
먼저 구분해야 할 것은 현재의 장애물이 기술적 경계인지, 컴플라이언스 경계인지입니다. 두 경우의 대응은 완전히 다릅니다. 기술적 한계는 엔지니어링 비용을 들여 일부 개선할 수 있지만, 컴플라이언스 한계는 다른 경로를 선택해야 합니다.

기술적 경계: 대응책은 계속 고도화된다
안티크롤링은 고정된 벽이 아닙니다. 요청 빈도 제한, 출발지 IP 검사, 행동 분석, 핑거프린트 식별 등이 번갈아 적용되고, 사이트는 HTML 구조와 스타일도 수시로 바꿉니다. 고정 규칙에 의존하는 파서는 언제든 무력화될 수 있습니다. 크롤러를 만들어 본 사람이라면 잘 알듯이, 가장 많은 시간이 드는 부분은 데이터 추출 자체가 아니라 상대의 변화에 맞춰 스크립트를 반복해서 고치는 작업인 경우가 많습니다.
동적 렌더링은 또 다른 비용입니다. 핵심 콘텐츠가 JS로 비동기 로딩되는 경우가 늘면서 정적 분석만으로는 가져올 수 없습니다. 결과를 얻으려면 헤드리스 브라우저로 실제 페이지를 실행해야 할 수 있습니다. 이 방법은 가능하지만 머신, 대역폭, 시간 비용이 늘고 속도는 느려집니다.
행동 검증의 비용은 더 눈에 잘 띄지 않습니다. 요청이 실제 사람의 동작처럼 보여야 하므로 수집 속도를 늦추고 동시성을 낮춰야 합니다. 작업 시간도 예측하기 어려워지고 수동 검토를 위한 여유도 필요합니다. 빠르면서 동시에 안정적이기를 기대하는 것은 현실적이지 않습니다.
또 하나 쉽게 놓치는 부분이 콘텐츠 개인화입니다. 같은 페이지라도 지역, 언어, 기기 유형이 다른 방문자에게 서로 다른 피드, 검색 결과, 심지어 가격을 보여줄 수 있습니다. 수집 결과를 충분히 포괄하려면 목표 시장의 실제 사용자 시각을 재현해야 하며, 이는 추가적인 엔지니어링 작업입니다.
컴플라이언스 경계: 느슨하게 해서는 안 되는 선
- robots 규칙: 사이트가 크롤링 가능하다고 밝힌 범위를 존중하는 것은 선택이 아니라 기본선입니다.
- 서비스 약관: 많은 플랫폼은 자동 수집을 명시적으로 금지합니다. 위반하면 계정 제한이나 법적 위험으로 이어질 수 있습니다.
- 데이터 권리: 콘텐츠를 가져올 수 있다고 해서 자유롭게 사용할 수 있다는 뜻은 아닙니다. 저작권이나 데이터베이스 권리가 있는 데이터는 특히 주의해야 합니다.
- 빈도 제한: 사이트가 명시적으로 금지하지 않더라도 동시성과 요청 간격을 제어해 상대 서비스를 과부하시키지 않아야 합니다.
CAPTCHA와 사람 확인은 별도로 봐야 합니다. 그 자체가 플랫폼이 자동 접근을 받아들이지 않는다는 명확한 신호입니다. 이를 단순히 극복해야 할 기술적 장애물로 취급하면 행위의 성격이 달라집니다.
컴플라이언스를 지키는 네 가지 수집 원칙
- 공개 데이터만 수집한다: 로그인이나 권한 부여가 필요한 콘텐츠는 공개 범위가 아닙니다.
- 빈도를 제어한다: 적절한 지연을 두고 동시성을 제한하며 요청량을 상대 서비스가 감당할 수 있는 수준으로 낮춥니다.
- 개인정보를 수집하지 않는다: 이름, 전화번호, 이메일, 주소 같은 필드는 다루지 않습니다.
- 사이트의 선언을 따른다: robots 규칙이나 서비스 약관에서 금지한 경로는 피합니다.
실무에서는 해외 진출 팀 대부분이 공식 API와 공개 데이터 세트만으로도 시장 조사 요구의 상당 부분을 충족할 수 있습니다. 업계 보고서, 오픈 데이터 플랫폼, 학술 데이터 세트 등이 여기에 포함됩니다. 요청 빈도와 권한 범위가 API 문서에 명시되어 있어 가장 관리하기 쉽습니다. 더 큰 규모나 특수한 데이터가 필요하면 유료 데이터 서비스나 데이터 보유자와의 정식 권한 협의를 고려할 수 있습니다. 필요한 표본이 많지 않다면 크롤러를 장기간 유지하는 비용보다 수작업 정리 비용이 더 낮은 경우가 많습니다.
반복해서 사용할 수 있는 판단 기준
장애물을 만나면 한 가지를 먼저 물어보면 됩니다. 플랫폼이 내가 이 일을 하고 있다는 사실을 안다면 인터페이스를 제공할까, 아니면 계정을 막을까?
전자라면 정상적인 상업 관계이므로 공식 인터페이스를 찾으면 됩니다. 후자라면 그 경로 자체가 허용되지 않는 것이므로 도구가 아니라 경로를 바꿔야 합니다.
여러 계정이 역할을 나눌 때의 환경 관리
일부 조사는 지역이나 카테고리별로 계정을 나눠야 할 수 있습니다. 예를 들어 시장별 검색 결과와 가격 차이를 따로 비교해야 하는 경우입니다. 핵심은 작업을 더 숨기는 것이 아니라 각 계정에 독립적이고 안정적인 환경을 제공해 한 계정의 제한이 다른 계정으로 번지지 않게 하는 것입니다. 이런 상황에서는 PurpleMark로 서로 다른 조사 계정마다 별도의 브라우저 환경을 만들고 해당 지역의 네트워크 출구에 연결해 이 과정을 일상적인 업무 흐름으로 고정할 수 있습니다.
반대로 환경을 정한 뒤에는 자주 바꾸지 않는 것이 중요합니다. 오늘은 네트워크 출구를 바꾸고 내일은 매개변수를 바꾸면 플랫폼 입장에서는 계정이 사용 중 계속 기기를 변경하는 것처럼 보일 수 있습니다. 그 신호 자체만으로도 의심스럽게 보일 수 있습니다.
마무리
요청 빈도, IP, 핑거프린트 문제는 엔지니어링으로 개선할 수 있지만 CAPTCHA와 사람 확인은 우회해서는 안 되는 규칙의 경계입니다. 데이터 소스를 크롤링 하나에만 의존하지 않고 공식 API, 공개 데이터 세트, 유료 서비스, 정식 권한 협력으로 넓히면 오히려 조사 과정이 더 안정적일 수 있습니다.


