GDPRとウェブスクレイピング: 個人データ、罰金、チェックリスト
GDPRはスクレイピングを禁止しているわけではありません。個人データを管理しています。適用される具体的な状況、正当な利益が唯一の現実的な根拠である理由、最近のEUの罰金が何を罰したのか、そしてエンジニアが実際に実行できるチェックリストを紹介します。
GDPRはウェブスクレイピングを禁止していません。個人データの処理を規制しており、収集したデータが個人を特定できる場合にのみ衝突します。この区別を正しく理解すれば、多くのコンプライアンスの質問は自ずと解決します。誤解すると、最近のEUの執行が非常に具体的に示したリスクを背負うことになります。これはエンジニアのガイドであり、講義ではありません: GDPRが実際にスクレイプに適用される場合、正当な利益が現実的に唯一の合法的な根拠である理由、規制当局が無視したことを罰し続けるデータ最小化と通知のルール、そしてジョブが始まる前に実行できるチェックリストです。これは情報提供のガイダンスであり、法的アドバイスではありません — 特定のプロジェクトにはデータ保護弁護士を関与させてください。
最初に重要な唯一の質問: それは個人データか?
GDPRは個人データを、特定されたまたは特定可能な人に関連する情報と定義しており、サーバーの場所に関わらずEU居住者のデータに適用されます。スクレイパーにとって実際の線引きは明確です。非個人データのスクレイピングは一般にGDPRの範囲外です: 製品価格と仕様、株式と市場データ、ニュースとブログコンテンツ、不動産リスト、公共の政府統計。データセットに名前、メールアドレス、電話番号、写真、プロフィール、またはIPアドレス、クッキーID、デバイスフィンガープリントのようなあまり明白でない識別子が含まれると、個人データを処理しており、規制の全重みがかかります。健康、バイオメトリクス、類似の「特別カテゴリ」データはさらにハードルを上げ、通常は明示的な同意が必要です。ターゲットが価格やカタログデータであれば、ほとんどの場合問題ありません; GDPR以外の法的な全体像は2026年にウェブスクレイピングは合法かにあります。
なぜ正当な利益が唯一の現実的な根拠なのか
GDPRの第6条には6つの合法的な根拠がリストされていますが、大規模なスクレイピングに適合するのは1つだけです。合意は非現実的です — まだ収集していない何百万もの人々から情報に基づく同意を得ることはできません。契約上の必要性は失敗します、なぜならデータ主体との関係がないからです。残るのは正当な利益で、EDPBのChatGPTタスクフォースとフランスのCNILの両方が条件付きで標準的な根拠として確認しています。それは文書化された三部テストを要求します: 利益が本当に正当であること、処理が必要で過剰でないこと、そしてデータを取得する人々の権利と合理的な期待を超えないことです。その正当な利益評価をスクレイプする前に書き留めてください; 「コンプライアンスを証明できないなら、コンプライアントではない」というのが規制当局が適用する運用原則です。

最近の罰金が実際に何を罰したのか
過去2年間の執行はリスクが集中する場所を正確に示しています。オランダのDPAは2024年にClearview AIに対して、公開された画像をスクレイプして顔認識データベースを構築し、人々に通知せず、アクセスと削除を提供しなかったとして3,050万ユーロの罰金を科しました — イタリアの規制当局は同じモデルに対してすでに2,000万ユーロを課していました。フランスのCNILは2024年12月にKASPRに対して、LinkedInの連絡先情報をスクレイプし、約1億6,000万件の連絡先のデータベースを作成したとして24万ユーロの罰金を科しました。ポーランドのDPAは、何百万人もの人々をカバーする公共の事業登録をスクレイプし、通知が「不釣り合いな努力」であると主張したデータブローカーに22万ユーロを課しました — 規制当局はそれを完全に拒否しました。これらすべての上限は、GDPRの最大2,000万ユーロまたは世界年間収益の4%のいずれか高い方です。
これらのケースを読み解くと、パターンは一貫しています: 違反は人々に通知しないこと、権利を無視すること、制限されたまたは過剰な個人データを収集すること、そして停止を命じられた後も続けることでした。それらのどれも「スクレイピングは違法である」に基づいていませんでした — それらは個人データの取り扱いに基づいていました。
エンジニアのチェックリスト
原則を実行するステップに変換し、ファイルするポリシーではありません。個人データに触れるジョブの前と中に:
- 収集時に最小化する。 文書化された目的に実際に必要なフィールドのみを保持します。コメントテキストが必要な場合、コメント投稿者の名前や仮名を一緒に保存しないでください。
- 自由にアクセスできるデータに限定する。 CNILのガイダンスでは、ログインを必要としない公開ページに留まるように言っています — 認証の背後や制限された可視性設定を超えてスクレイプしないでください。
- 技術的な反対を尊重する。 robots.txtやCAPTCHAはサイトが自動収集を望んでいないシグナルです; それを無視すると法的立場が弱まります。詳細はrobots.txtの実践にあります。
- 保持期限を設定する。 個人データは目的を果たしたら削除してください; 無期限の保存は保存制限違反です。
- 第14条とDSARに備える。 データ主体に通知し、アクセスと削除要求を処理できるようにしてください — Clearviewとポーランドのケースを沈めた失敗です。
- 大規模または高リスクの収集にはDPIAを実行するし、文書を保持してください。
これらのうち2つは文字通りコードです。最小化は、収集するつもりのなかったPIIを削除するフィルターです:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
そしてサイトの明示的な希望を尊重することは、最初のリクエストの前に標準ライブラリを使用して行うチェックです:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

プロキシが適合する場所 — しない場所
プロキシは公共データに確実にアクセスし、適切な地理からアクセスするためのインフラです; コンプライアンスの近道ではありません。スクレイパーAPIや住宅IPを通じてスクレイプをルーティングすることは、合法的な根拠があるかどうかを変えませんし、収集すべきでない個人データを洗浄することもありません。彼らが本当に役立つのは、コンプライアントな道を歩むことを助けることです: 公共の非個人データを大規模に収集すること — 価格、カタログ、市場信号 — これはまさにほとんどのチームが実際に必要とする低リスクの作業です。プロジェクトが人々のデータに触れる場合、例えばB2Bの連絡先調査など、コンプライアンスを最初から設計制約として扱ってください。これはLinkedInの公開データとコンプライアンスで説明しています。
よくある質問
GDPRの下でウェブスクレイピングは合法ですか?
スクレイピングはGDPRによって禁止されていませんが、EU居住者の個人データを処理するには合法的な根拠と規制の原則に従う必要があります。非個人データのみをスクレイプする場合 — 価格、在庫レベル、ニュース — GDPRは一般に適用されません。データが人を特定する場合、文書化された根拠(通常は正当な利益)、データ最小化、保持期限、データ主体の権利を尊重する方法が必要です。
GDPRを侵害せずにスクレイプできる個人データは何ですか?
最も安全な立場は、個人データを完全に避けることです: 製品、価格、在庫、市場、ニュース、公共の統計データは通常GDPRの範囲外です。個人データを処理する必要がある場合、自由にアクセスできる公開情報に限定し、文書化された目的に必要なものだけを収集し、人々に通知し、削除要求を処理できるように準備してください。健康情報のような特別カテゴリのデータは、明示的な同意がない限り避けてください。
私の会社がEU外にある場合、GDPRは適用されますか?
はい。GDPRは、あなたがどこにいるかではなく、誰のデータを処理するかに基づいて適用されます。EUまたはEEAの個人の個人データをスクレイプする場合、会社の国に関係なく規制が適用されます。非EUの個人に関するデータをスクレイプする場合、それらの管轄の法律に従いますが、EUのケースは、EU居住者のデータを扱う外国のオペレーターを追求することを示しています。
スクレイピングに対するGDPRの最大罰金は何ですか?
GDPRの上限は2,000万ユーロまたは世界年間収益の4%のいずれか高い方です。実際のスクレイピングの罰金は6桁の範囲 — 登録スクレイプに対する22万ユーロ、LinkedInの連絡先スクレイプに対する24万ユーロ — からClearview AIに対する3,050万ユーロまであります。共通のテーマは個人データの誤処理です: 通知なし、権利の無視、過剰な収集。
コンプライアントな道は「何でも公開されているものをスクレイプする」よりも狭く、「スクレイピングは違法だ」よりもはるかに広いです。可能な限り非個人データに留まり、正当な利益を文書化し、できない場合は最小化し、サイトが示すシグナルを尊重し、証拠を保持してください。それを行えば、GDPRは設計制約であり、脅威ではありません。