GDPR i web scraping: dane osobowe, kary i lista kontrolna
GDPR nie zakazuje scrapingu — reguluje dane osobowe. Oto kiedy dokładnie ma zastosowanie, dlaczego uzasadniony interes jest jedyną realistyczną podstawą, jakie kary nałożyła ostatnio UE i lista kontrolna, którą inżynierowie mogą faktycznie przeprowadzić.
GDPR nie zakazuje web scrapingu. Reguluje przetwarzanie danych osobowych, a scraping koliduje z nim tylko wtedy, gdy zbierane dane mogą identyfikować osobę. Zrozum tę różnicę, a większość pytań dotyczących zgodności sama się rozwiąże; popełnij błąd, a odziedziczysz ryzyko, które ostatnie egzekwowanie przez UE uczyniło bardzo konkretnym. To przewodnik dla inżyniera, a nie wykład: kiedy GDPR faktycznie ma zastosowanie do scrapingu, dlaczego uzasadniony interes jest realistycznie jedyną legalną podstawą, zasady minimalizacji danych i powiadamiania, za ignorowanie których regulatorzy wciąż karzą, oraz lista kontrolna, którą można przeprowadzić przed rozpoczęciem pracy. To informacyjne wskazówki, a nie porada prawna — w przypadku konkretnego projektu zaangażuj prawnika ds. ochrony danych.
Jedno pytanie, które ma znaczenie na początku: czy to są dane osobowe?
GDPR definiuje dane osobowe jako wszelkie informacje dotyczące zidentyfikowanej lub możliwej do zidentyfikowania osoby i ma zastosowanie do danych mieszkańców UE niezależnie od tego, gdzie znajdują się Twoje serwery. Praktyczna granica dla scraperów jest jasna. Scraping danych nieosobowych generalnie nie podlega GDPR: ceny produktów i specyfikacje, dane giełdowe i rynkowe, treści wiadomości i blogów, oferty nieruchomości, publiczne statystyki rządowe. W momencie, gdy Twój zestaw danych zawiera nazwiska, adresy e-mail, numery telefonów, zdjęcia, profile — lub mniej oczywiste identyfikatory, takie jak adresy IP, identyfikatory cookie i odciski palców urządzeń — przetwarzasz dane osobowe i pełna waga regulacji się do tego odnosi. Dane zdrowotne, biometryczne i podobne 'szczególne kategorie' danych podnoszą poprzeczkę jeszcze wyżej, zazwyczaj wymagając wyraźnej zgody. Jeśli Twoim celem są ceny i dane katalogowe, jesteś w większości bezpieczny; szerszy obraz prawny poza GDPR znajduje się w czy web scraping jest legalny w 2026.
Dlaczego uzasadniony interes jest Twoją jedyną realistyczną podstawą
Artykuł 6 GDPR wymienia sześć legalnych podstaw, ale tylko jedna pasuje do scrapingu na dużą skalę. Zgoda jest niepraktyczna — nie możesz uzyskać świadomej zgody od milionów osób, których danych jeszcze nie zebrałeś. Konieczność umowna odpada, ponieważ nie masz relacji z podmiotami danych. Pozostaje uzasadniony interes, a Taskforce ChatGPT EDPB i francuski CNIL potwierdzają go jako standardową podstawę — z warunkami. Wymaga udokumentowanego testu trójczęściowego: interes jest rzeczywiście uzasadniony, przetwarzanie jest konieczne i nie nadmierne, i nie narusza praw i uzasadnionych oczekiwań osób, których dane zbierasz. Zapisz tę Ocenę Uzasadnionego Interesu przed scrapowaniem; 'jeśli nie możesz udowodnić zgodności, nie jesteś zgodny' to zasada działania stosowana przez regulatorów.

Co faktycznie ukarały ostatnie kary
Egzekwowanie z ostatnich dwóch lat mówi dokładnie, gdzie koncentruje się ryzyko. Holenderski DPA nałożył na Clearview AI karę w wysokości 30,5 miliona EUR w 2024 roku za zbudowanie bazy danych rozpoznawania twarzy z publicznie zebranych obrazów bez informowania ludzi lub oferowania dostępu i usunięcia — włoski regulator już wcześniej nałożył karę w wysokości 20 milionów EUR za ten sam model. Francuski CNIL nałożył na KASPR karę w wysokości 240 000 EUR w grudniu 2024 roku za scrapowanie danych kontaktowych z LinkedIn, w tym od użytkowników, którzy ograniczyli ich widoczność, w bazie danych obejmującej około 160 milionów kontaktów. Polski DPA nałożył karę w wysokości 220 000 EUR na brokera danych, który scrapował publiczne rejestry biznesowe obejmujące miliony osób, a następnie argumentował, że powiadamianie ich to 'nieproporcjonalny wysiłek' — regulator odrzucił to jednoznacznie. Sufit tego wszystkiego to maksymalna kara GDPR w wysokości 20 milionów EUR lub 4% globalnych rocznych przychodów, w zależności od tego, która wartość jest wyższa.
Przeczytaj te przypadki i wzór jest spójny: naruszenia polegały na nieinformowaniu ludzi, ignorowaniu ich praw, zbieraniu ograniczonych lub nadmiernych danych osobowych i kontynuowaniu po nakazaniu zaprzestania. Żaden z nich nie opierał się na 'scraping jest nielegalny' — opierały się na tym, jak dane osobowe były traktowane.
Lista kontrolna dla inżyniera
Przetłumacz zasady na kroki, które wykonujesz, a nie na politykę, którą archiwizujesz. Przed i w trakcie każdej pracy, która dotyka danych osobowych:
- Minimalizuj w momencie zbierania. Przechowuj tylko te pola, które faktycznie potrzebujesz do swojego udokumentowanego celu. Jeśli potrzebujesz tekstu komentarza, nie przechowuj nazwiska i pseudonimu komentatora obok niego.
- Ogranicz się do swobodnie dostępnych danych. Wytyczne CNIL mówią, aby pozostać na publicznych stronach, które nie wymagają logowania — nie scrapuj za uwierzytelnieniem ani poza ustawieniami ograniczonej widoczności.
- Szanuj techniczne sprzeciwy. robots.txt i CAPTCHA to sygnały, że strona nie chce automatycznego zbierania; ignorowanie ich osłabia Twoją pozycję prawną. Szczegóły w robots.txt w praktyce.
- Ustaw limity przechowywania. Usuń dane osobowe, gdy spełniły swój cel; nieokreślone przechowywanie to naruszenie ograniczenia przechowywania.
- Planuj zgodnie z Artykułem 14 i DSAR. Bądź w stanie informować podmioty danych oraz obsługiwać żądania dostępu i usunięcia — to niepowodzenie, które pogrążyło przypadki Clearview i Polski.
- Przeprowadź DPIA dla zbierania na dużą skalę lub o wyższym ryzyku i zachowaj dokumentację.
Dwa z nich to dosłownie kod. Minimalizacja to filtr, który usuwa PII, które nie zamierzałeś zbierać:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
A szanowanie wyrażonych życzeń strony to kontrola, którą wykonujesz przed pierwszym żądaniem, używając standardowej biblioteki:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

Gdzie pasują proxy — i gdzie nie
Proxy to infrastruktura do niezawodnego dostępu do danych publicznych z odpowiedniej geografii; nie są skrótem do zgodności. Przekierowanie scrapingu przez scraper API lub adresy IP rezydentów nie zmienia tego, czy masz legalną podstawę, i nie 'czyści' danych osobowych, których nie powinieneś zbierać. Tam, gdzie naprawdę pomagają, to utrzymanie Cię na ścieżce zgodności: zbieranie tylko publicznych, nieosobowych danych na dużą skalę — ceny, katalogi, sygnały rynkowe — co jest dokładnie tym, czego większość zespołów faktycznie potrzebuje. Jeśli Twój projekt dotyka danych osobowych, takich jak badania kontaktów B2B, traktuj zgodność jako ograniczenie projektowe od samego początku, jak przedstawiamy w LinkedIn publiczne dane i zgodność.
Często zadawane pytania
Czy web scraping jest legalny zgodnie z GDPR?
Scraping nie jest zakazany przez GDPR, ale przetwarzanie danych osobowych mieszkańców UE wymaga legalnej podstawy i zgodności z zasadami regulacji. Jeśli scrapujesz tylko dane nieosobowe — ceny, poziomy zapasów, wiadomości — GDPR zazwyczaj nie ma zastosowania. Jeśli Twoje dane identyfikują osoby, potrzebujesz udokumentowanej podstawy (zazwyczaj uzasadnionego interesu), minimalizacji danych, limitów przechowywania i sposobu na honorowanie praw podmiotów danych.
Jakie dane osobowe mogę scrapować bez naruszania GDPR?
Najbezpieczniejszą pozycją jest unikanie danych osobowych w ogóle: dane o produktach, cenach, zapasach, rynku, wiadomościach i publiczne dane statystyczne zazwyczaj nie podlegają GDPR. Kiedy musisz przetwarzać dane osobowe, ogranicz je do swobodnie dostępnych informacji publicznych, zbieraj tylko to, co wymaga Twój udokumentowany cel, i bądź gotowy do informowania ludzi oraz obsługi żądań usunięcia. Unikaj danych szczególnej kategorii, takich jak informacje zdrowotne, chyba że masz wyraźną zgodę.
Czy GDPR ma zastosowanie, jeśli moja firma jest poza UE?
Tak. GDPR ma zastosowanie w oparciu o to, czyje dane przetwarzasz, a nie gdzie się znajdujesz. Jeśli scrapujesz dane osobowe osób w UE lub EOG, regulacja ma zastosowanie niezależnie od kraju Twojej firmy. Scrapowanie danych dotyczących tylko osób spoza UE podlega prawom tych jurysdykcji, ale przypadki UE pokazują, że regulatorzy będą ścigać zagranicznych operatorów przetwarzających dane mieszkańców UE.
Jaka jest maksymalna kara GDPR za scraping?
Maksymalna kara GDPR to 20 milionów EUR lub 4% globalnych rocznych przychodów, w zależności od tego, która wartość jest wyższa. Rzeczywiste kary za scraping wahały się od sześciocyfrowych — 220 000 EUR za scraping rejestru, 240 000 EUR za scrapowanie kontaktów z LinkedIn — do 30,5 miliona EUR przeciwko Clearview AI. Wspólnym wątkiem jest niewłaściwe postępowanie z danymi osobowymi: brak powiadomienia, ignorowanie praw i nadmierne zbieranie.
Ścieżka zgodności jest węższa niż 'scrapuj cokolwiek publicznego' i znacznie szersza niż 'scraping jest nielegalny'. Pozostań przy danych nieosobowych, gdzie możesz, dokumentuj uzasadniony interes i minimalizuj, gdzie nie możesz, szanuj sygnały, które dają Ci strony, i zachowaj dowody. Zrób to, a GDPR będzie ograniczeniem projektowym, a nie zagrożeniem.