GDPR 및 웹 스크래핑: 개인 데이터, 벌금 및 체크리스트

GDPR은 스크래핑을 금지하지 않습니다 — 개인 데이터를 규제합니다. 언제 적용되는지, 왜 정당한 이익이 유일한 현실적인 근거인지, 최근 EU 벌금이 무엇을 처벌했는지, 그리고 엔지니어가 실제로 실행할 수 있는 체크리스트를 소개합니다.

GDPR은 웹 스크래핑을 금지하지 않습니다. 그것은 개인 데이터의 처리를 규제하며, 수집한 데이터가 개인을 식별할 수 있을 때만 충돌합니다. 이 구분을 정확히 이해하면 대부분의 준수 질문이 스스로 해결됩니다; 잘못 이해하면 최근 EU 집행이 매우 구체적으로 만든 노출을 상속받게 됩니다. 이것은 엔지니어의 가이드이며 강의가 아닙니다: GDPR이 실제로 스크랩에 적용되는 시점, 왜 정당한 이익이 현실적으로 유일한 합법적 근거인지, 규제 기관이 사람들이 무시하는 것을 계속 처벌하는 데이터 최소화 및 통지 규칙, 그리고 작업이 시작되기 전에 실행할 수 있는 체크리스트입니다. 이는 정보 제공을 위한 지침이며 법률 자문이 아닙니다 — 특정 프로젝트의 경우 데이터 보호 변호사를 참여시키십시오.

가장 먼저 중요한 질문: 그것이 개인 데이터인가?

GDPR은 개인 데이터를 식별되거나 식별 가능한 개인과 관련된 모든 정보로 정의하며, 서버의 위치와 상관없이 EU 거주자의 데이터에 적용됩니다. 스크래퍼에게 실질적인 경계는 명확합니다. 비개인 데이터를 스크래핑하는 것은 일반적으로 GDPR의 범위 밖에 있습니다: 제품 가격 및 사양, 주식 및 시장 수치, 뉴스 및 블로그 콘텐츠, 부동산 목록, 공공 정부 통계. 데이터셋에 이름, 이메일 주소, 전화번호, 사진, 프로필 — 또는 IP 주소, 쿠키 ID 및 장치 지문과 같은 덜 명백한 식별자가 포함되는 순간, 개인 데이터를 처리하고 있으며 규제의 모든 무게가 부여됩니다. 건강, 생체 및 유사한 '특별 범주' 데이터는 기준을 더욱 높이며, 일반적으로 명시적 동의가 필요합니다. 목표가 가격 및 카탈로그 데이터라면, 대부분은 명확합니다; GDPR을 넘어서는 더 넓은 법적 그림은 2026년에 웹 스크래핑이 합법적인가에 있습니다.

왜 정당한 이익이 유일한 현실적인 근거인가

GDPR의 제6조는 여섯 가지 합법적 근거를 나열하지만, 대규모 스크래핑에 맞는 것은 하나뿐입니다. 동의는 비현실적입니다 — 아직 수집하지 않은 수백만 명의 사람들로부터 정보에 입각한 동의를 얻을 수 없습니다. 계약상 필요성은 데이터 주체와의 관계가 없기 때문에 실패합니다. 남은 것은 정당한 이익이며, EDPB의 ChatGPT 태스크포스와 프랑스의 CNIL은 조건과 함께 이를 표준 근거로 확인합니다. 이는 문서화된 세 가지 테스트를 요구합니다: 이익이 진정으로 정당하며, 처리가 필요하고 과도하지 않으며, 데이터 주체의 권리와 합리적 기대를 무시하지 않습니다. 스크래핑 전에 그 정당한 이익 평가를 작성하십시오; '준수를 증명할 수 없다면, 준수하지 않은 것입니다'라는 원칙이 규제 기관이 적용하는 운영 원칙입니다.

GDPR의 범위를 벗어나는 스크랩 데이터(예: 가격 및 뉴스)와 GDPR을 촉발하는 데이터(예: 이름, 이메일, IP 주소 및 프로필)를 보여주는 체크리스트
촉발 요인은 EU 거주자의 개인 데이터이며 그 외에는 없습니다. 가격, 주식 및 뉴스는 보통 명확합니다; 개인을 식별하는 모든 것은 전체 규제를 끌어들입니다.

최근 벌금이 실제로 무엇을 처벌했는가

지난 2년간의 집행은 위험이 집중되는 곳을 정확히 알려줍니다. 네덜란드 DPA는 2024년에 Clearview AI에 대해 공개 이미지에서 스크랩한 얼굴 인식 데이터베이스를 구축하면서 사람들에게 알리지 않거나 접근 및 삭제를 제공하지 않았다는 이유로 3,050만 유로의 벌금을 부과했습니다 — 이탈리아 규제 기관은 이미 같은 모델에 대해 2,000만 유로를 부과했습니다. 프랑스의 CNIL은 2024년 12월에 LinkedIn 연락처 정보를 스크랩한 KASPR에 대해 24만 유로의 벌금을 부과했습니다. 이는 약 1억 6천만 개의 연락처 데이터베이스에서 가시성을 제한한 사용자로부터도 스크랩한 것입니다. 폴란드의 DPA는 수백만 명을 대상으로 한 공공 사업자 등록부를 스크랩하고 이를 알리는 것이 '불균형한 노력'이라고 주장한 데이터 브로커에 대해 22만 유로를 부과했습니다 — 규제 기관은 이를 단호히 거부했습니다. 이 모든 것의 상한선은 GDPR 최대 2천만 유로 또는 전 세계 연간 수익의 4% 중 더 높은 금액입니다.

이 사례들을 살펴보면 패턴은 일관됩니다: 위반은 사람들에게 알리지 않고, 그들의 권리를 무시하고, 제한되거나 과도한 개인 데이터를 수집하고, 중지 요청 후에도 계속하는 것이었습니다. 이들 중 어느 것도 '스크래핑이 불법이다'에 기반하지 않았습니다 — 그것들은 개인 데이터가 어떻게 처리되었는지에 기반했습니다.

엔지니어의 체크리스트

원칙을 실행할 단계로 번역하십시오, 파일로 보관하는 정책이 아닙니다. 개인 데이터를 다루는 모든 작업 전후에:

이 중 두 가지는 문자 그대로 코드입니다. 최소화는 수집할 의도가 없었던 PII를 제거하는 필터입니다:

KEEP = {"product", "price", "currency", "rating", "review_text"}
PII  = {"reviewer_name", "email", "user_id", "ip"}

def minimize(record):
    # keep only declared fields; never persist PII you did not need
    return {k: v for k, v in record.items() if k in KEEP and k not in PII}

그리고 사이트의 명시된 의사를 존중하는 것은 첫 번째 요청 전에 표준 라이브러리를 사용하여 수행하는 확인입니다:

import urllib.robotparser as rp

def allowed(url, ua="MyResearchBot"):
    r = rp.RobotFileParser()
    r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
              url.split("/")[2] + "/robots.txt")
    r.read()
    return r.can_fetch(ua, url)
웹 스크래핑 개인 데이터에 대한 최근 EU GDPR 벌금의 통계 패널: Clearview AI, KASPR LinkedIn 스크래핑, 폴란드 등록부 사례, 및 4% 수익 상한선
벌금은 스크래핑 자체가 아닌 처리 방식을 처벌했습니다: 알림 없음, 무시된 권리, 과도하거나 제한된 데이터, 그리고 중지 요청 후에도 계속 진행한 것.

프록시의 적합성 — 그리고 부적합성

프록시는 공공 데이터를 신뢰할 수 있게 적절한 지리적 위치에서 접근하기 위한 인프라입니다; 이는 준수 지름길이 아닙니다. 스크래퍼 API나 주거 IP를 통해 스크랩을 라우팅하는 것은 합법적 근거를 변경하지 않으며, 수집해서는 안 되는 개인 데이터를 세탁하지 않습니다. 그들이 진정으로 도움이 되는 것은 준수 경로를 유지하는 것입니다: 대규모로 공공, 비개인 데이터를 수집하는 것 — 가격, 카탈로그, 시장 신호 — 이는 대부분의 팀이 실제로 필요로 하는 저위험 작업입니다. 프로젝트가 사람들의 데이터를 다루는 경우, 예를 들어 B2B 연락처 연구, 준수를 시작부터 설계 제약으로 취급하십시오, 이는 우리가 LinkedIn 공공 데이터 및 준수에서 설명하는 방식입니다.

자주 묻는 질문

GDPR 하에서 웹 스크래핑이 합법적인가?

GDPR은 스크래핑을 금지하지 않지만, EU 거주자의 개인 데이터를 처리하는 것은 합법적 근거와 규제의 원칙 준수가 필요합니다. 비개인 데이터만 스크래핑한다면 — 가격, 재고 수준, 뉴스 — GDPR은 일반적으로 적용되지 않습니다. 데이터가 사람을 식별한다면, 문서화된 근거(보통 정당한 이익), 데이터 최소화, 보유 한도 및 데이터 주체 권리를 존중하는 방법이 필요합니다.

GDPR을 위반하지 않고 어떤 개인 데이터를 스크래핑할 수 있습니까?

가장 안전한 위치는 개인 데이터를 완전히 피하는 것입니다: 제품, 가격, 재고, 시장, 뉴스 및 공공 통계 데이터는 일반적으로 GDPR의 범위 밖에 있습니다. 개인 데이터를 처리해야 할 때는 자유롭게 접근할 수 있는 공공 정보로 제한하고, 문서화된 목적에 필요한 것만 수집하며, 사람들에게 알리고 삭제 요청을 처리할 준비가 되어 있어야 합니다. 건강 정보와 같은 특별 범주 데이터는 명시적 동의가 없는 한 피하십시오.

회사가 EU 외부에 있는 경우 GDPR이 적용됩니까?

네. GDPR은 처리하는 데이터의 주체에 따라 적용되며, 위치에 따라 적용되지 않습니다. EU 또는 EEA의 개인 데이터를 스크래핑하면, 회사의 국가와 상관없이 규제가 적용됩니다. 비EU 개인에 관한 데이터를 스크래핑하는 것은 해당 관할권의 법률에 따라 다르지만, EU 사례는 EU 거주자의 데이터를 처리하는 외국 운영자를 규제 기관이 추적할 것임을 보여줍니다.

스크래핑에 대한 최대 GDPR 벌금은 얼마입니까?

GDPR의 상한선은 2천만 유로 또는 전 세계 연간 수익의 4% 중 더 높은 금액입니다. 실제 스크래핑 벌금은 6자리 수 — 등록부 스크래핑에 대해 22만 유로, LinkedIn 연락처 스크래핑에 대해 24만 유로 — 에서 Clearview AI에 대한 3,050만 유로까지 다양했습니다. 공통점은 개인 데이터 처리의 부적절함: 알림 없음, 무시된 권리, 과도한 수집입니다.

준수 경로는 '공개된 모든 것을 스크래핑하라'보다 좁고 '스크래핑은 불법이다'보다 훨씬 넓습니다. 가능한 한 비개인 데이터에 머물고, 정당한 이익을 문서화하고, 그렇지 않은 경우 최소화하며, 사이트가 주는 신호를 존중하고, 증거를 보관하십시오. 그렇게 하면 GDPR은 위협이 아닌 설계 제약이 됩니다.

Scraper API로 공공, 비개인 데이터를 수집하십시오