GDPR y Web Scraping: Datos Personales, Multas y una Lista de Verificación
El GDPR no prohíbe el scraping, regula los datos personales. Aquí te explicamos exactamente cuándo se aplica, por qué el interés legítimo es tu única base realista, qué castigaron las recientes multas de la UE y una lista de verificación que los ingenieros pueden realmente ejecutar.
El GDPR no prohíbe el web scraping. Regula el procesamiento de datos personales, y el scraping solo choca con él cuando los datos que recolectas pueden identificar a una persona. Comprende bien esa distinción y la mayoría de las preguntas de cumplimiento se responden solas; si te equivocas, heredas la exposición que la reciente aplicación de la UE ha hecho muy concreta. Esta es una guía para ingenieros, no una conferencia: cuándo se aplica realmente el GDPR a un scraping, por qué el interés legítimo es realísticamente tu única base legal, las reglas de minimización de datos y notificación por las que los reguladores siguen castigando a las personas por ignorar, y una lista de verificación que puedes ejecutar antes de comenzar un trabajo. Es una guía informativa y no un consejo legal; para un proyecto específico, involucra a un abogado de protección de datos.
La única pregunta que importa primero: ¿son datos personales?
El GDPR define los datos personales como cualquier información relacionada con una persona identificada o identificable, y se aplica a los datos de los residentes de la UE independientemente de dónde se encuentren tus servidores. La línea práctica para los scrapers es clara. Scraping de datos no personales generalmente queda fuera del GDPR por completo: precios y especificaciones de productos, cifras de acciones y mercado, contenido de noticias y blogs, listados de bienes raíces, estadísticas públicas del gobierno. En el momento en que tu conjunto de datos contiene nombres, direcciones de correo electrónico, números de teléfono, fotos, perfiles — o los identificadores menos obvios como direcciones IP, IDs de cookies y huellas digitales de dispositivos — estás procesando datos personales y se aplica todo el peso de la regulación. Los datos de salud, biométricos y similares de 'categoría especial' elevan aún más el listón, generalmente requiriendo consentimiento explícito. Si tu objetivo son los precios y datos de catálogos, estás mayormente en claro; el panorama legal más amplio más allá del GDPR está en es legal el web scraping en 2026.
Por qué el interés legítimo es tu única base realista
El Artículo 6 del GDPR enumera seis bases legales, pero solo una se ajusta al scraping a gran escala. El consentimiento es impráctico: no puedes obtener un acuerdo informado de millones de personas cuyos datos aún no has recolectado. La necesidad contractual falla porque no tienes relación con los sujetos de los datos. Eso deja el interés legítimo, y tanto el Grupo de Trabajo de ChatGPT del EDPB como la CNIL de Francia lo confirman como la base estándar, con condiciones. Exige una prueba documentada de tres partes: el interés es genuinamente legítimo, el procesamiento es necesario y no excesivo, y no anula los derechos y expectativas razonables de las personas cuyos datos tomas. Escribe esa Evaluación de Interés Legítimo antes de hacer scraping; 'si no puedes probar el cumplimiento, no estás cumpliendo' es el principio operativo que aplican los reguladores.

Lo que realmente castigaron las recientes multas
La aplicación de los últimos dos años te dice exactamente dónde se concentra el riesgo. La DPA holandesa multó a Clearview AI con 30,5 millones de euros en 2024 por construir una base de datos de reconocimiento facial a partir de imágenes públicas recolectadas sin informar a las personas ni ofrecer acceso y eliminación; el regulador italiano ya había impuesto 20 millones de euros por el mismo modelo. La CNIL de Francia multó a KASPR con 240.000 euros en diciembre de 2024 por recolectar detalles de contacto de LinkedIn, incluidos de usuarios que habían restringido su visibilidad, en una base de datos de aproximadamente 160 millones de contactos. La DPA de Polonia impuso 220.000 euros a un corredor de datos que recolectó registros públicos de negocios que cubrían a millones de personas y luego argumentó que notificarlos era un 'esfuerzo desproporcionado'; el regulador rechazó eso de plano. El techo de todo esto es el máximo del GDPR de 20 millones de euros o el 4% de los ingresos anuales globales, lo que sea mayor.
Lee a través de esos casos y el patrón es consistente: las violaciones fueron no informar a las personas, ignorar sus derechos, recolectar datos personales restringidos o excesivos, y continuar después de que se les dijo que se detuvieran. Ninguno de ellos se basó en 'el scraping es ilegal', se basaron en cómo se manejaron los datos personales.
La lista de verificación del ingeniero
Traduce los principios en pasos que ejecutas, no en una política que archivas. Antes y durante cualquier trabajo que toque datos personales:
- Minimiza en el punto de recolección. Solo conserva los campos que realmente necesitas para tu propósito documentado. Si necesitas el texto de un comentario, no almacenes el nombre y seudónimo del comentarista junto a él.
- Limita a datos libremente accesibles. La guía de la CNIL dice que te mantengas en páginas públicas que no requieren inicio de sesión; no hagas scraping detrás de la autenticación o más allá de configuraciones de visibilidad restringida.
- Respeta las objeciones técnicas. robots.txt y CAPTCHA son señales de que un sitio no quiere recolección automatizada; ignorarlas debilita tu posición legal. Detalles en robots.txt en la práctica.
- Establece límites de retención. Elimina los datos personales una vez que han cumplido su propósito; el almacenamiento indefinido es una violación de la limitación de almacenamiento.
- Planifica para el Artículo 14 y DSARs. Sé capaz de informar a los sujetos de datos y manejar solicitudes de acceso y eliminación, el fallo que hundió los casos de Clearview y Polonia.
- Realiza un DPIA para la recolección a gran escala o de mayor riesgo, y conserva la documentación.
Dos de estos son literalmente código. La minimización es un filtro que elimina PII que no te propusiste recolectar:
KEEP = {"product", "price", "currency", "rating", "review_text"}
PII = {"reviewer_name", "email", "user_id", "ip"}
def minimize(record):
# keep only declared fields; never persist PII you did not need
return {k: v for k, v in record.items() if k in KEEP and k not in PII}
Y respetar los deseos declarados del sitio es un chequeo que haces antes de la primera solicitud, usando la biblioteca estándar:
import urllib.robotparser as rp
def allowed(url, ua="MyResearchBot"):
r = rp.RobotFileParser()
r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
url.split("/")[2] + "/robots.txt")
r.read()
return r.can_fetch(ua, url)

Dónde encajan los proxies — y dónde no
Los proxies son infraestructura para acceder a datos públicos de manera confiable y desde la geografía correcta; no son un atajo de cumplimiento. Enrutar un scraping a través de un scraper API o IPs residenciales no cambia si tienes una base legal, y no blanquea datos personales que no deberías estar recolectando. Donde realmente ayudan es manteniéndote en el camino del cumplimiento: recolectando solo datos públicos y no personales a gran escala — precios, catálogos, señales de mercado — que es exactamente el trabajo de bajo riesgo que la mayoría de los equipos realmente necesitan. Si tu proyecto toca datos de personas, como la investigación de contactos B2B, trata el cumplimiento como la restricción de diseño desde el principio, como enmarcamos en datos públicos de LinkedIn y cumplimiento.
Preguntas frecuentes
¿Es legal el web scraping bajo el GDPR?
El scraping no está prohibido por el GDPR, pero procesar datos personales de residentes de la UE requiere una base legal y el cumplimiento de los principios del reglamento. Si solo haces scraping de datos no personales — precios, niveles de stock, noticias — el GDPR generalmente no se aplica. Si tus datos identifican a personas, necesitas una base documentada (generalmente interés legítimo), minimización de datos, límites de retención y una forma de honrar los derechos de los sujetos de datos.
¿Qué datos personales puedo recolectar sin infringir el GDPR?
La posición más segura es evitar los datos personales por completo: productos, precios, stock, mercado, noticias y datos estadísticos públicos típicamente quedan fuera del GDPR. Cuando debes procesar datos personales, limítalos a información pública libremente accesible, recolecta solo lo que tu propósito documentado requiere, y prepárate para informar a las personas y manejar solicitudes de eliminación. Evita datos de categoría especial como información de salud a menos que tengas consentimiento explícito.
¿Se aplica el GDPR si mi empresa está fuera de la UE?
Sí. El GDPR se aplica en función de cuyos datos procesas, no de dónde estás ubicado. Si haces scraping de datos personales de individuos en la UE o EEE, el reglamento se aplica independientemente del país de tu empresa. Hacer scraping de datos que solo conciernen a individuos no pertenecientes a la UE cae bajo las leyes de esas jurisdicciones, pero los casos de la UE muestran que los reguladores perseguirán a operadores extranjeros que manejen datos de residentes de la UE.
¿Cuál es la multa máxima del GDPR por scraping?
El techo del GDPR es de 20 millones de euros o el 4% de los ingresos anuales globales, lo que sea mayor. Las sanciones reales por scraping han oscilado desde seis cifras — 220.000 euros por un scraping de registro, 240.000 euros por scraping de contactos de LinkedIn — hasta 30,5 millones de euros contra Clearview AI. El hilo común es el mal manejo de los datos personales: sin notificación, derechos ignorados y recolección excesiva.
El camino del cumplimiento es más estrecho que 'recolectar cualquier cosa pública' y mucho más amplio que 'el scraping es ilegal'. Mantente en datos no personales donde puedas, documenta el interés legítimo y minimiza donde no puedas, respeta las señales que te dan los sitios y guarda los recibos. Haz eso y el GDPR es una restricción de diseño, no una amenaza.