GDPR y Web Scraping: Datos Personales, Multas y una Lista de Verificación

El GDPR no prohíbe el scraping, regula los datos personales. Aquí te explicamos exactamente cuándo se aplica, por qué el interés legítimo es tu única base realista, qué castigaron las recientes multas de la UE y una lista de verificación que los ingenieros pueden realmente ejecutar.

El GDPR no prohíbe el web scraping. Regula el procesamiento de datos personales, y el scraping solo choca con él cuando los datos que recolectas pueden identificar a una persona. Comprende bien esa distinción y la mayoría de las preguntas de cumplimiento se responden solas; si te equivocas, heredas la exposición que la reciente aplicación de la UE ha hecho muy concreta. Esta es una guía para ingenieros, no una conferencia: cuándo se aplica realmente el GDPR a un scraping, por qué el interés legítimo es realísticamente tu única base legal, las reglas de minimización de datos y notificación por las que los reguladores siguen castigando a las personas por ignorar, y una lista de verificación que puedes ejecutar antes de comenzar un trabajo. Es una guía informativa y no un consejo legal; para un proyecto específico, involucra a un abogado de protección de datos.

La única pregunta que importa primero: ¿son datos personales?

El GDPR define los datos personales como cualquier información relacionada con una persona identificada o identificable, y se aplica a los datos de los residentes de la UE independientemente de dónde se encuentren tus servidores. La línea práctica para los scrapers es clara. Scraping de datos no personales generalmente queda fuera del GDPR por completo: precios y especificaciones de productos, cifras de acciones y mercado, contenido de noticias y blogs, listados de bienes raíces, estadísticas públicas del gobierno. En el momento en que tu conjunto de datos contiene nombres, direcciones de correo electrónico, números de teléfono, fotos, perfiles — o los identificadores menos obvios como direcciones IP, IDs de cookies y huellas digitales de dispositivos — estás procesando datos personales y se aplica todo el peso de la regulación. Los datos de salud, biométricos y similares de 'categoría especial' elevan aún más el listón, generalmente requiriendo consentimiento explícito. Si tu objetivo son los precios y datos de catálogos, estás mayormente en claro; el panorama legal más amplio más allá del GDPR está en es legal el web scraping en 2026.

Por qué el interés legítimo es tu única base realista

El Artículo 6 del GDPR enumera seis bases legales, pero solo una se ajusta al scraping a gran escala. El consentimiento es impráctico: no puedes obtener un acuerdo informado de millones de personas cuyos datos aún no has recolectado. La necesidad contractual falla porque no tienes relación con los sujetos de los datos. Eso deja el interés legítimo, y tanto el Grupo de Trabajo de ChatGPT del EDPB como la CNIL de Francia lo confirman como la base estándar, con condiciones. Exige una prueba documentada de tres partes: el interés es genuinamente legítimo, el procesamiento es necesario y no excesivo, y no anula los derechos y expectativas razonables de las personas cuyos datos tomas. Escribe esa Evaluación de Interés Legítimo antes de hacer scraping; 'si no puedes probar el cumplimiento, no estás cumpliendo' es el principio operativo que aplican los reguladores.

Lista de verificación que muestra qué datos recolectados están fuera del GDPR, como precios y noticias, frente a datos que desencadenan el GDPR, como nombres, correos electrónicos, direcciones IP y perfiles
El desencadenante son los datos personales de los residentes de la UE y nada más. Los precios, acciones y noticias son generalmente claros; cualquier cosa que identifique a una persona activa toda la regulación.

Lo que realmente castigaron las recientes multas

La aplicación de los últimos dos años te dice exactamente dónde se concentra el riesgo. La DPA holandesa multó a Clearview AI con 30,5 millones de euros en 2024 por construir una base de datos de reconocimiento facial a partir de imágenes públicas recolectadas sin informar a las personas ni ofrecer acceso y eliminación; el regulador italiano ya había impuesto 20 millones de euros por el mismo modelo. La CNIL de Francia multó a KASPR con 240.000 euros en diciembre de 2024 por recolectar detalles de contacto de LinkedIn, incluidos de usuarios que habían restringido su visibilidad, en una base de datos de aproximadamente 160 millones de contactos. La DPA de Polonia impuso 220.000 euros a un corredor de datos que recolectó registros públicos de negocios que cubrían a millones de personas y luego argumentó que notificarlos era un 'esfuerzo desproporcionado'; el regulador rechazó eso de plano. El techo de todo esto es el máximo del GDPR de 20 millones de euros o el 4% de los ingresos anuales globales, lo que sea mayor.

Lee a través de esos casos y el patrón es consistente: las violaciones fueron no informar a las personas, ignorar sus derechos, recolectar datos personales restringidos o excesivos, y continuar después de que se les dijo que se detuvieran. Ninguno de ellos se basó en 'el scraping es ilegal', se basaron en cómo se manejaron los datos personales.

La lista de verificación del ingeniero

Traduce los principios en pasos que ejecutas, no en una política que archivas. Antes y durante cualquier trabajo que toque datos personales:

Dos de estos son literalmente código. La minimización es un filtro que elimina PII que no te propusiste recolectar:

KEEP = {"product", "price", "currency", "rating", "review_text"}
PII  = {"reviewer_name", "email", "user_id", "ip"}

def minimize(record):
    # keep only declared fields; never persist PII you did not need
    return {k: v for k, v in record.items() if k in KEEP and k not in PII}

Y respetar los deseos declarados del sitio es un chequeo que haces antes de la primera solicitud, usando la biblioteca estándar:

import urllib.robotparser as rp

def allowed(url, ua="MyResearchBot"):
    r = rp.RobotFileParser()
    r.set_url(url.rstrip("/").split("/", 3)[0] + "//" +
              url.split("/")[2] + "/robots.txt")
    r.read()
    return r.can_fetch(ua, url)
Panel estadístico de las recientes multas de la UE por GDPR para el web scraping de datos personales: Clearview AI, scraping de LinkedIn de KASPR, un caso de registro en Polonia y el límite del 4 por ciento de los ingresos
Las multas castigaron el manejo, no el scraping en sí: sin notificación, derechos ignorados, datos excesivos o restringidos, y continuar después de ser informado de detenerse.

Dónde encajan los proxies — y dónde no

Los proxies son infraestructura para acceder a datos públicos de manera confiable y desde la geografía correcta; no son un atajo de cumplimiento. Enrutar un scraping a través de un scraper API o IPs residenciales no cambia si tienes una base legal, y no blanquea datos personales que no deberías estar recolectando. Donde realmente ayudan es manteniéndote en el camino del cumplimiento: recolectando solo datos públicos y no personales a gran escala — precios, catálogos, señales de mercado — que es exactamente el trabajo de bajo riesgo que la mayoría de los equipos realmente necesitan. Si tu proyecto toca datos de personas, como la investigación de contactos B2B, trata el cumplimiento como la restricción de diseño desde el principio, como enmarcamos en datos públicos de LinkedIn y cumplimiento.

Preguntas frecuentes

¿Es legal el web scraping bajo el GDPR?

El scraping no está prohibido por el GDPR, pero procesar datos personales de residentes de la UE requiere una base legal y el cumplimiento de los principios del reglamento. Si solo haces scraping de datos no personales — precios, niveles de stock, noticias — el GDPR generalmente no se aplica. Si tus datos identifican a personas, necesitas una base documentada (generalmente interés legítimo), minimización de datos, límites de retención y una forma de honrar los derechos de los sujetos de datos.

¿Qué datos personales puedo recolectar sin infringir el GDPR?

La posición más segura es evitar los datos personales por completo: productos, precios, stock, mercado, noticias y datos estadísticos públicos típicamente quedan fuera del GDPR. Cuando debes procesar datos personales, limítalos a información pública libremente accesible, recolecta solo lo que tu propósito documentado requiere, y prepárate para informar a las personas y manejar solicitudes de eliminación. Evita datos de categoría especial como información de salud a menos que tengas consentimiento explícito.

¿Se aplica el GDPR si mi empresa está fuera de la UE?

Sí. El GDPR se aplica en función de cuyos datos procesas, no de dónde estás ubicado. Si haces scraping de datos personales de individuos en la UE o EEE, el reglamento se aplica independientemente del país de tu empresa. Hacer scraping de datos que solo conciernen a individuos no pertenecientes a la UE cae bajo las leyes de esas jurisdicciones, pero los casos de la UE muestran que los reguladores perseguirán a operadores extranjeros que manejen datos de residentes de la UE.

¿Cuál es la multa máxima del GDPR por scraping?

El techo del GDPR es de 20 millones de euros o el 4% de los ingresos anuales globales, lo que sea mayor. Las sanciones reales por scraping han oscilado desde seis cifras — 220.000 euros por un scraping de registro, 240.000 euros por scraping de contactos de LinkedIn — hasta 30,5 millones de euros contra Clearview AI. El hilo común es el mal manejo de los datos personales: sin notificación, derechos ignorados y recolección excesiva.

El camino del cumplimiento es más estrecho que 'recolectar cualquier cosa pública' y mucho más amplio que 'el scraping es ilegal'. Mantente en datos no personales donde puedas, documenta el interés legítimo y minimiza donde no puedas, respeta las señales que te dan los sitios y guarda los recibos. Haz eso y el GDPR es una restricción de diseño, no una amenaza.

Recolecta datos públicos y no personales con el Scraper API