GDPR e Web Scraping: Dati Personali, Sanzioni e una Checklist
Il GDPR non vieta lo scraping — regola i dati personali. Ecco esattamente quando si applica, perché l'interesse legittimo è la tua unica base realistica, cosa hanno punito le recenti sanzioni dell'UE e una checklist che gli ingegneri possono effettivamente utilizzare.
Il GDPR non vieta il web scraping. Regola il trattamento dei dati personali, e lo scraping collide con esso solo quando i dati raccolti possono identificare una persona. Comprendere questa distinzione risolve la maggior parte delle domande sulla conformità; sbagliarla significa ereditare l'esposizione che le recenti applicazioni dell'UE hanno reso molto concreta. Questa è una guida per ingegneri, non una lezione: quando il GDPR si applica effettivamente a uno scraping, perché l'interesse legittimo è realisticamente la tua unica base legale, le regole di minimizzazione dei dati e notifica che i regolatori continuano a punire per essere ignorate, e una checklist che puoi eseguire prima di iniziare un lavoro. È una guida informativa e non un consiglio legale — per un progetto specifico, coinvolgi un avvocato specializzato in protezione dei dati.
La prima domanda che conta: è un dato personale?
Il GDPR definisce i dati personali come qualsiasi informazione relativa a una persona identificata o identificabile, e si applica ai dati dei residenti dell'UE indipendentemente da dove si trovano i tuoi server. La linea pratica per gli scraper è chiara. Lo scraping di dati non personali generalmente si colloca al di fuori del GDPR: prezzi e specifiche dei prodotti, dati di borsa e di mercato, contenuti di notizie e blog, annunci immobiliari, statistiche pubbliche governative. Nel momento in cui il tuo dataset contiene nomi, indirizzi email, numeri di telefono, foto, profili — o identificatori meno ovvi come indirizzi IP, ID cookie e impronte digitali dei dispositivi — stai trattando dati personali e si applica tutto il peso della regolamentazione. I dati sanitari, biometrici e simili 'categorie speciali' alzano ulteriormente l'asticella, richiedendo generalmente un consenso esplicito. Se il tuo obiettivo sono i prezzi e i dati di catalogo, sei per lo più al sicuro; il quadro legale più ampio oltre il GDPR è in lo scraping è legale nel 2026.
Perché l'interesse legittimo è la tua unica base realistica
L'Articolo 6 del GDPR elenca sei basi legali, ma solo una si adatta allo scraping su larga scala. Il consenso è impraticabile — non puoi ottenere un accordo informato da milioni di persone i cui dati non hai ancora raccolto. La necessità contrattuale fallisce perché non hai alcun rapporto con i soggetti dei dati. Resta l'interesse legittimo, e la Taskforce ChatGPT dell'EDPB e la CNIL francese lo confermano come la base standard — con condizioni. Richiede un test documentato in tre parti: l'interesse è genuinamente legittimo, il trattamento è necessario e non eccessivo, e non prevale sui diritti e le aspettative ragionevoli delle persone i cui dati raccogli. Scrivi quella Valutazione di Interesse Legittimo prima di fare scraping; 'se non puoi dimostrare la conformità, non sei conforme' è il principio operativo applicato dai regolatori.

Cosa hanno punito effettivamente le recenti sanzioni
L'applicazione degli ultimi due anni ti dice esattamente dove si concentra il rischio. L'autorità olandese per la protezione dei dati ha multato Clearview AI di 30,5 milioni di euro nel 2024 per aver costruito un database di riconoscimento facciale da immagini pubbliche raccolte senza informare le persone o offrire accesso e cancellazione — il regolatore italiano aveva già imposto una multa di 20 milioni di euro per lo stesso modello. La CNIL francese ha multato KASPR di 240.000 euro a dicembre 2024 per aver raccolto dettagli di contatto da LinkedIn, inclusi utenti che avevano limitato la loro visibilità, su un database di circa 160 milioni di contatti. L'autorità polacca per la protezione dei dati ha imposto una multa di 220.000 euro a un broker di dati che ha raccolto registri commerciali pubblici coprendo milioni di persone e poi ha sostenuto che notificarli era uno 'sforzo sproporzionato' — il regolatore ha respinto categoricamente questa affermazione. Il tetto massimo di tutto ciò è il massimo del GDPR di 20 milioni di euro o il 4% del fatturato annuo globale, a seconda di quale sia superiore.
Leggi attraverso quei casi e il modello è coerente: le violazioni erano il mancato avviso alle persone, l'ignorare i loro diritti, la raccolta di dati personali limitati o eccessivi, e il continuare dopo essere stati invitati a fermarsi. Nessuno di loro si è basato su 'lo scraping è illegale' — si sono basati su come sono stati gestiti i dati personali.
La checklist dell'ingegnere
Traduci i principi in passi che esegui, non in una politica che archivi. Prima e durante qualsiasi lavoro che tocchi dati personali:
- Minimizza al punto di raccolta. Conserva solo i campi di cui hai effettivamente bisogno per il tuo scopo documentato. Se hai bisogno del testo di un commento, non memorizzare il nome e lo pseudonimo del commentatore insieme ad esso.
- Limita ai dati liberamente accessibili. La guida della CNIL dice di rimanere su pagine pubbliche che non richiedono login — non fare scraping dietro autenticazione o oltre impostazioni di visibilità limitata.
- Rispetta le obiezioni tecniche. robots.txt e CAPTCHA sono segnali che un sito non desidera la raccolta automatizzata; ignorarli indebolisce la tua posizione legale. Dettagli in robots.txt in pratica.
- Imposta limiti di conservazione. Elimina i dati personali una volta che hanno servito il loro scopo; la conservazione indefinita è una violazione della limitazione della conservazione.
- Pianifica per l'Articolo 14 e le DSAR. Sii in grado di informare i soggetti dei dati e gestire le richieste di accesso e cancellazione — il fallimento che ha affondato i casi Clearview e Polonia.
- Esegui una DPIA per la raccolta su larga scala o ad alto rischio, e conserva la documentazione.
Due di questi sono letteralmente codice. La minimizzazione è un filtro che elimina i PII che non hai intenzione di raccogliere:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
E rispettare i desideri dichiarati del sito è un controllo che fai prima della prima richiesta, utilizzando la libreria standard:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

Dove si inseriscono i proxy — e dove no
I proxy sono infrastrutture per raggiungere dati pubblici in modo affidabile e dalla giusta geografia; non sono una scorciatoia per la conformità. Instradare uno scraping attraverso una scraper API o IP residenziali non cambia se hai una base legale, e non ripulisce i dati personali che non dovresti raccogliere. Dove aiutano veramente è mantenendoti sul percorso di conformità: raccogliendo solo dati pubblici, non personali su larga scala — prezzi, cataloghi, segnali di mercato — che è esattamente il lavoro a basso rischio di cui la maggior parte dei team ha effettivamente bisogno. Se il tuo progetto tocca i dati delle persone, come la ricerca di contatti B2B, tratta la conformità come il vincolo di progettazione fin dall'inizio, come inquadriamo in LinkedIn dati pubblici e conformità.
Domande frequenti
Lo scraping è legale sotto il GDPR?
Lo scraping non è vietato dal GDPR, ma il trattamento dei dati personali dei residenti dell'UE richiede una base legale e la conformità ai principi del regolamento. Se fai scraping solo di dati non personali — prezzi, livelli di stock, notizie — il GDPR generalmente non si applica. Se i tuoi dati identificano persone, hai bisogno di una base documentata (di solito interesse legittimo), minimizzazione dei dati, limiti di conservazione e un modo per onorare i diritti dei soggetti dei dati.
Quali dati personali posso raccogliere senza violare il GDPR?
La posizione più sicura è evitare del tutto i dati personali: dati di prodotto, prezzo, stock, mercato, notizie e dati statistici pubblici tipicamente ricadono al di fuori del GDPR. Quando devi trattare dati personali, limitati a informazioni pubbliche liberamente accessibili, raccogli solo ciò che il tuo scopo documentato richiede, e sii pronto a informare le persone e gestire le richieste di cancellazione. Evita dati di categoria speciale come informazioni sanitarie a meno che tu non abbia un consenso esplicito.
Il GDPR si applica se la mia azienda è al di fuori dell'UE?
Sì. Il GDPR si applica in base ai dati che tratti, non a dove ti trovi. Se fai scraping di dati personali di individui nell'UE o nello SEE, il regolamento si applica indipendentemente dal paese della tua azienda. Lo scraping di dati che riguardano solo individui non UE ricade sotto le leggi di quelle giurisdizioni, ma i casi dell'UE mostrano che i regolatori perseguiranno operatori stranieri che trattano dati di residenti dell'UE.
Qual è la sanzione massima del GDPR per lo scraping?
Il tetto massimo del GDPR è di 20 milioni di euro o il 4% del fatturato annuo globale, a seconda di quale sia superiore. Le sanzioni reali per lo scraping sono variate da sei cifre — 220.000 euro per uno scraping di registri, 240.000 euro per lo scraping di contatti LinkedIn — a 30,5 milioni di euro contro Clearview AI. Il filo comune è la cattiva gestione dei dati personali: nessuna notifica, diritti ignorati e raccolta eccessiva.
Il percorso conforme è più stretto di 'raccogliere qualsiasi cosa pubblica' e molto più ampio di 'lo scraping è illegale'. Rimani sui dati non personali dove puoi, documenta l'interesse legittimo e minimizza dove non puoi, rispetta i segnali che i siti ti danno, e conserva le prove. Fai questo e il GDPR è un vincolo di progettazione, non una minaccia.