GDPR & Web Scraping: Persoonsgegevens, Boetes & een Checklist
GDPR verbiedt scraping niet — het reguleert persoonsgegevens. Hier is precies wanneer het van toepassing is, waarom gerechtvaardigd belang je enige realistische basis is, wat de recente EU-boetes bestraften, en een checklist die ingenieurs daadwerkelijk kunnen uitvoeren.
GDPR verbiedt web scraping niet. Het reguleert de verwerking van persoonsgegevens, en scraping komt er alleen mee in botsing wanneer de gegevens die je verzamelt een persoon kunnen identificeren. Maak dat onderscheid goed en de meeste compliancevragen beantwoorden zichzelf; maak het fout en je erft de blootstelling die recente EU-handhaving heel concreet heeft gemaakt. Dit is een gids voor ingenieurs, geen lezing: wanneer GDPR daadwerkelijk van toepassing is op een scrape, waarom gerechtvaardigd belang realistisch je enige wettelijke basis is, de dataminimalisatie- en meldingsregels waarvoor toezichthouders mensen blijven straffen voor het negeren, en een checklist die je kunt uitvoeren voordat een klus begint. Het is informatieve begeleiding en geen juridisch advies — voor een specifiek project, betrek een gegevensbeschermingsadvocaat.
De enige vraag die er eerst toe doet: zijn het persoonsgegevens?
GDPR definieert persoonsgegevens als alle informatie die betrekking heeft op een geïdentificeerde of identificeerbare persoon, en het is van toepassing op de gegevens van EU-inwoners, ongeacht waar je servers zich bevinden. De praktische grens voor scrapers is duidelijk. Het scrapen van niet-persoonsgegevens valt over het algemeen volledig buiten GDPR: productprijzen en specificaties, aandelen- en marktgegevens, nieuws- en bloginhoud, vastgoedvermeldingen, openbare overheidsstatistieken. Zodra je dataset namen, e-mailadressen, telefoonnummers, foto's, profielen bevat — of de minder voor de hand liggende identificatoren zoals IP-adressen, cookie-ID's en apparaatvingerafdrukken — verwerk je persoonsgegevens en is de volledige regelgeving van toepassing. Gezondheids-, biometrische en soortgelijke 'speciale categorie'-gegevens verhogen de lat verder, meestal vereist het expliciete toestemming. Als je doel prijzen en catalogusgegevens zijn, ben je grotendeels veilig; het bredere juridische plaatje buiten GDPR is in is web scraping legaal in 2026.
Waarom gerechtvaardigd belang je enige realistische basis is
Artikel 6 van de GDPR somt zes wettelijke basis op, maar slechts één past bij grootschalig scrapen. Toestemming is onpraktisch — je kunt geen geïnformeerde toestemming krijgen van miljoenen mensen wiens gegevens je nog niet hebt verzameld. Contractuele noodzaak faalt omdat je geen relatie hebt met de betrokkenen. Dat laat gerechtvaardigd belang over, en zowel de ChatGPT Taskforce van de EDPB als de CNIL van Frankrijk bevestigen dit als de standaardbasis — onder voorwaarden. Het vereist een gedocumenteerde drievoudige test: het belang is echt gerechtvaardigd, de verwerking is noodzakelijk en niet buitensporig, en het doet geen afbreuk aan de rechten en redelijke verwachtingen van de mensen wiens gegevens je verzamelt. Schrijf die Legitimate Interest Assessment op voordat je gaat scrapen; 'als je geen naleving kunt bewijzen, ben je niet compliant' is het werkingsprincipe dat toezichthouders toepassen.

Wat de recente boetes daadwerkelijk bestraften
De handhaving van de afgelopen twee jaar vertelt je precies waar het risico zich concentreert. De Nederlandse AP beboette Clearview AI met EUR 30,5 miljoen in 2024 voor het opbouwen van een gezichtsherkenningsdatabase van gescrapete openbare afbeeldingen zonder mensen te informeren of toegang en verwijdering aan te bieden — de Italiaanse toezichthouder had al EUR 20 miljoen opgelegd voor hetzelfde model. De CNIL van Frankrijk beboette KASPR met EUR 240.000 in december 2024 voor het scrapen van LinkedIn-contactgegevens, ook van gebruikers die hun zichtbaarheid hadden beperkt, over een database van ongeveer 160 miljoen contacten. De Poolse AP legde EUR 220.000 op aan een databroker die openbare bedrijfsregisters had gescrapet die miljoenen mensen omvatten en vervolgens beweerde dat het informeren van hen een 'onevenredige inspanning' was — de toezichthouder verwierp dat resoluut. Het plafond van dit alles is het GDPR maximum van EUR 20 miljoen of 4% van de wereldwijde jaaromzet, afhankelijk van welke hoger is.
Lees door die gevallen heen en het patroon is consistent: de overtredingen waren het niet informeren van mensen, het negeren van hun rechten, het verzamelen van beperkte of buitensporige persoonsgegevens, en doorgaan nadat ze waren gevraagd te stoppen. Geen van hen draaide om 'scraping is illegaal' — ze draaiden om hoe persoonsgegevens werden behandeld.
De checklist van de ingenieur
Vertaal de principes in stappen die je uitvoert, niet in een beleid dat je archiveert. Voor en tijdens elke klus die persoonsgegevens raakt:
- Minimaliseer bij het verzamelen. Bewaar alleen velden die je daadwerkelijk nodig hebt voor je gedocumenteerde doel. Als je commentaartekst nodig hebt, sla dan niet de naam en het pseudoniem van de commentator op.
- Beperk tot vrij toegankelijke gegevens. CNIL-richtlijnen zeggen dat je op openbare pagina's moet blijven die geen inlog vereisen — scrape niet achter authenticatie of voorbij instellingen met beperkte zichtbaarheid.
- Respecteer technische bezwaren. robots.txt en CAPTCHA zijn signalen dat een site geen geautomatiseerde verzameling wil; het negeren ervan verzwakt je juridische positie. Details in robots.txt in de praktijk.
- Stel bewaarlimieten in. Verwijder persoonsgegevens zodra ze hun doel hebben gediend; onbeperkte opslag is een schending van de opslagbeperking.
- Plan voor Artikel 14 en DSARs. Wees in staat om betrokkenen te informeren en om te gaan met toegang- en verwijderingsverzoeken — de mislukking die de Clearview- en Polen-gevallen deed zinken.
- Voer een DPIA uit voor grootschalige of risicovollere verzameling, en houd de documentatie bij.
Twee van deze zijn letterlijk code. Minimalisatie is een filter dat PII verwijdert die je niet van plan was te verzamelen:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
En het respecteren van de aangegeven wensen van de site is een controle die je uitvoert voordat het eerste verzoek wordt gedaan, met behulp van de standaardbibliotheek:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

Waar proxies passen — en niet
Proxies zijn infrastructuur voor het betrouwbaar bereiken van openbare gegevens vanuit de juiste geografie; ze zijn geen nalevingskorting. Het routeren van een scrape via een scraper API of residentiële IP's verandert niet of je een wettelijke basis hebt, en het wast geen persoonsgegevens die je niet zou moeten verzamelen. Waar ze echt helpen, is je op het nalevingspad houden: alleen openbare, niet-persoonsgegevens op grote schaal verzamelen — prijzen, catalogi, marktsignalen — wat precies het laagrisicowerk is dat de meeste teams daadwerkelijk nodig hebben. Als je project wel persoonsgegevens raakt, zoals B2B-contactonderzoek, behandel naleving dan als de ontwerpeis vanaf het begin, zoals we kaderen in LinkedIn openbare gegevens en naleving.
Veelgestelde vragen
Is web scraping legaal onder GDPR?
Scraping is niet verboden door GDPR, maar het verwerken van persoonsgegevens van EU-inwoners vereist een wettelijke basis en naleving van de principes van de verordening. Als je alleen niet-persoonsgegevens scrapt — prijzen, voorraadniveaus, nieuws — is GDPR over het algemeen niet van toepassing. Als je gegevens mensen identificeren, heb je een gedocumenteerde basis nodig (meestal gerechtvaardigd belang), dataminimalisatie, bewaarlimieten en een manier om de rechten van betrokkenen te honoreren.
Welke persoonsgegevens kan ik scrapen zonder GDPR te schenden?
De veiligste positie is om persoonsgegevens helemaal te vermijden: product-, prijs-, voorraad-, markt-, nieuws- en openbare statistische gegevens vallen doorgaans buiten GDPR. Wanneer je persoonsgegevens moet verwerken, beperk het dan tot vrij toegankelijke openbare informatie, verzamel alleen wat je gedocumenteerde doel vereist, en wees bereid om mensen te informeren en verwijderingsverzoeken te behandelen. Vermijd gegevens van speciale categorieën zoals gezondheidsinformatie, tenzij je expliciete toestemming hebt.
Is GDPR van toepassing als mijn bedrijf buiten de EU is gevestigd?
Ja. GDPR is van toepassing op basis van wiens gegevens je verwerkt, niet waar je je bevindt. Als je persoonsgegevens van individuen in de EU of EER scrapt, is de verordening van toepassing ongeacht het land van je bedrijf. Het scrapen van gegevens die alleen niet-EU-individuen betreffen, valt onder de wetten van die jurisdicties, maar de EU-gevallen tonen aan dat toezichthouders buitenlandse operators zullen vervolgen die gegevens van EU-inwoners verwerken.
Wat is de maximale GDPR-boete voor scraping?
Het GDPR-plafond is EUR 20 miljoen of 4% van de wereldwijde jaaromzet, afhankelijk van welke hoger is. Echte scrapingboetes varieerden van zes cijfers — EUR 220.000 voor een registerscrape, EUR 240.000 voor LinkedIn-contactscraping — tot EUR 30,5 miljoen tegen Clearview AI. De gemeenschappelijke draad is het verkeerd omgaan met persoonsgegevens: geen melding, genegeerde rechten, en buitensporige verzameling.
Het nalevingspad is smaller dan 'scrape alles wat openbaar is' en veel breder dan 'scraping is illegaal'. Blijf bij niet-persoonsgegevens waar je kunt, documenteer gerechtvaardigd belang en minimaliseer waar je dat niet kunt, respecteer de signalen die sites je geven, en bewaar de bewijzen. Doe dat en GDPR is een ontwerpeis, geen bedreiging.