GDPR e Web Scraping: Dados Pessoais, Multas e um Checklist
O GDPR não proíbe o scraping — ele regula dados pessoais. Aqui está exatamente quando ele se aplica, por que o interesse legítimo é sua única base realista, o que as recentes multas da UE puniram e um checklist que os engenheiros podem realmente executar.
O GDPR não proíbe o web scraping. Ele regula o processamento de dados pessoais, e o scraping só colide com ele quando os dados que você coleta podem identificar uma pessoa. Entenda essa distinção corretamente e a maioria das perguntas sobre conformidade se responde por si; entenda errado e você herda a exposição que a recente aplicação da UE tornou muito concreta. Este é um guia para engenheiros, não uma palestra: quando o GDPR realmente se aplica a um scraping, por que o interesse legítimo é realisticamente sua única base legal, as regras de minimização de dados e notificação que os reguladores continuam punindo as pessoas por ignorar, e um checklist que você pode executar antes de um trabalho começar. É uma orientação informativa e não um conselho legal — para um projeto específico, envolva um advogado de proteção de dados.
A única questão que importa primeiro: são dados pessoais?
O GDPR define dados pessoais como qualquer informação relacionada a uma pessoa identificada ou identificável, e se aplica aos dados de residentes da UE, independentemente de onde seus servidores estejam. A linha prática para scrapers é clara. Scraping de dados não pessoais geralmente fica completamente fora do GDPR: preços e especificações de produtos, ações e números de mercado, conteúdo de notícias e blogs, listagens de imóveis, estatísticas públicas do governo. No momento em que seu conjunto de dados contém nomes, endereços de e-mail, números de telefone, fotos, perfis — ou os identificadores menos óbvios como endereços IP, IDs de cookies e impressões digitais de dispositivos — você está processando dados pessoais e todo o peso da regulamentação se aplica. Dados de saúde, biométricos e similares de 'categoria especial' elevam ainda mais o nível, geralmente exigindo consentimento explícito. Se seu alvo são preços e dados de catálogo, você está em grande parte seguro; o panorama jurídico mais amplo além do GDPR está em web scraping é legal em 2026.
Por que o interesse legítimo é sua única base realista
O Artigo 6 do GDPR lista seis bases legais, mas apenas uma se encaixa no scraping em larga escala. Consentimento é impraticável — você não pode obter acordo informado de milhões de pessoas cujos dados você ainda não coletou. Necessidade contratual falha porque você não tem relação com os titulares dos dados. Isso deixa o interesse legítimo, e tanto a Força-Tarefa ChatGPT do EDPB quanto a CNIL da França confirmam como a base padrão — com condições. Exige um teste de três partes documentado: o interesse é genuinamente legítimo, o processamento é necessário e não excessivo, e não sobrepõe os direitos e expectativas razoáveis das pessoas cujos dados você coleta. Escreva essa Avaliação de Interesse Legítimo antes de fazer o scraping; 'se você não pode provar conformidade, você não está em conformidade' é o princípio operacional que os reguladores aplicam.

O que as recentes multas realmente puniram
A aplicação dos últimos dois anos diz exatamente onde o risco se concentra. A DPA holandesa multou a Clearview AI em EUR 30,5 milhões em 2024 por construir um banco de dados de reconhecimento facial a partir de imagens públicas raspadas sem informar as pessoas ou oferecer acesso e exclusão — o regulador italiano já havia aplicado EUR 20 milhões pelo mesmo modelo. A CNIL da França multou a KASPR em EUR 240.000 em dezembro de 2024 por raspar detalhes de contato do LinkedIn, incluindo de usuários que haviam restringido sua visibilidade, em um banco de dados de aproximadamente 160 milhões de contatos. A DPA da Polônia impôs EUR 220.000 a um corretor de dados que raspou registros públicos de negócios cobrindo milhões de pessoas e depois argumentou que notificá-las era um 'esforço desproporcional' — o regulador rejeitou isso de imediato. O teto de tudo isso é o máximo do GDPR de EUR 20 milhões ou 4% da receita anual global, o que for maior.
Leia esses casos e o padrão é consistente: as violações foram não informar as pessoas, ignorar seus direitos, coletar dados pessoais restritos ou excessivos e continuar após ser informado para parar. Nenhum deles se baseou em 'scraping é ilegal' — eles se basearam em como os dados pessoais foram tratados.
O checklist do engenheiro
Traduza os princípios em etapas que você executa, não uma política que você arquiva. Antes e durante qualquer trabalho que toque dados pessoais:
- Minimize no ponto de coleta. Mantenha apenas os campos que você realmente precisa para seu propósito documentado. Se você precisa do texto de um comentário, não armazene o nome e o pseudônimo do comentarista junto com ele.
- Limite-se a dados livremente acessíveis. A orientação da CNIL diz para permanecer em páginas públicas que não exigem login — não faça scraping por trás de autenticação ou além de configurações de visibilidade restritas.
- Respeite objeções técnicas. robots.txt e CAPTCHA são sinais de que um site não quer coleta automatizada; ignorá-los enfraquece sua posição legal. Detalhes em robots.txt na prática.
- Defina limites de retenção. Exclua dados pessoais assim que eles tiverem cumprido seu propósito; armazenamento indefinido é uma violação de limitação de armazenamento.
- Planeje para o Artigo 14 e DSARs. Seja capaz de informar os titulares dos dados e lidar com solicitações de acesso e exclusão — a falha que afundou os casos da Clearview e da Polônia.
- Execute um DPIA para coleta em larga escala ou de maior risco, e mantenha a documentação.
Dois destes são literalmente código. Minimização é um filtro que descarta PII que você não pretendia coletar:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
E respeitar os desejos declarados do site é uma verificação que você faz antes da primeira solicitação, usando a biblioteca padrão:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

Onde os proxies se encaixam — e não
Proxies são infraestrutura para acessar dados públicos de forma confiável e da geografia certa; eles não são um atalho para conformidade. Roteando um scraping através de uma API de scraping ou IPs residenciais não muda se você tem uma base legal, e não 'lava' dados pessoais que você não deveria estar coletando. Onde eles realmente ajudam é mantendo você no caminho da conformidade: coletando apenas dados públicos e não pessoais em escala — preços, catálogos, sinais de mercado — que é exatamente o trabalho de baixo risco que a maioria das equipes realmente precisa. Se seu projeto tocar dados de pessoas, como pesquisa de contatos B2B, trate a conformidade como a restrição de design desde o início, como enquadramos em dados públicos do LinkedIn e conformidade.
Perguntas frequentes
O web scraping é legal sob o GDPR?
O scraping não é proibido pelo GDPR, mas o processamento de dados pessoais de residentes da UE requer uma base legal e conformidade com os princípios do regulamento. Se você raspa apenas dados não pessoais — preços, níveis de estoque, notícias — o GDPR geralmente não se aplica. Se seus dados identificam pessoas, você precisa de uma base documentada (geralmente interesse legítimo), minimização de dados, limites de retenção e uma maneira de honrar os direitos dos titulares dos dados.
Quais dados pessoais posso raspar sem violar o GDPR?
A posição mais segura é evitar dados pessoais por completo: dados de produtos, preços, estoque, mercado, notícias e estatísticas públicas geralmente estão fora do GDPR. Quando você deve processar dados pessoais, limite-os a informações públicas livremente acessíveis, colete apenas o que seu propósito documentado exige e esteja pronto para informar as pessoas e lidar com pedidos de exclusão. Evite dados de categoria especial, como informações de saúde, a menos que você tenha consentimento explícito.
O GDPR se aplica se minha empresa estiver fora da UE?
Sim. O GDPR se aplica com base em cujos dados você processa, não onde você está localizado. Se você raspa dados pessoais de indivíduos na UE ou EEE, o regulamento se aplica independentemente do país da sua empresa. Raspar dados que dizem respeito apenas a indivíduos fora da UE está sob as leis dessas jurisdições, mas os casos da UE mostram que os reguladores perseguirão operadores estrangeiros que lidam com dados de residentes da UE.
Qual é a multa máxima do GDPR para scraping?
O teto do GDPR é de EUR 20 milhões ou 4% da receita anual global, o que for maior. As penalidades reais de scraping variaram de seis dígitos — EUR 220.000 por um scraping de registro, EUR 240.000 por scraping de contatos no LinkedIn — a EUR 30,5 milhões contra a Clearview AI. O fio comum é o manuseio inadequado de dados pessoais: nenhuma notificação, direitos ignorados e coleta excessiva.
O caminho da conformidade é mais estreito do que 'raspe qualquer coisa pública' e muito mais amplo do que 'scraping é ilegal'. Fique em dados não pessoais onde puder, documente o interesse legítimo e minimize onde não puder, respeite os sinais que os sites lhe dão e mantenha os registros. Faça isso e o GDPR é uma restrição de design, não uma ameaça.