¿Puedo entrenar IA con datos públicos? La respuesta legal es complicada

La pregunta parece sencilla: si los datos están disponibles públicamente, ¿puedes usarlos para entrenar IA? La respuesta en todas las jurisdicciones principales es: depende, y "disponible públicamente" no es lo mismo que "disponible legalmente para cualquier propósito."

Derecho de autor

La disponibilidad pública no anula el derecho de autor. Los artículos, imágenes, código, música y demás obras creativas publicados públicamente suelen estar protegidos por derechos de autor. Usarlos para entrenar IA puede constituir o no un uso legítimo (fair use, en EE. UU.), un trato justo (fair dealing, en el Reino Unido, Australia y Canadá), o una excepción aplicable. Esta es la cuestión central en NYT contra OpenAI (demanda presentada en diciembre de 2023, en curso), Sarah Silverman y otros, y decenas de casos similares contra proveedores de modelos fundacionales. La guía de mayo de 2025 de la Oficina de Derechos de Autor de EE. UU. confirmó que las obras generadas íntegramente por IA no son susceptibles de protección por derechos de autor. El marco de derechos de autor de Japón ha sido relativamente permisivo con el entrenamiento de IA, pero está siendo puesto a prueba (Yomiuri Shimbun contra Perplexity, 2025). Las excepciones de minería de textos y datos de la UE (Directiva 2019/790) permiten la minería con fines de investigación y con fines comerciales cuando los titulares de derechos no se han excluido expresamente (opt-out).

Derecho de protección de datos

Si los datos públicos incluyen datos personales (nombres, rostros, perfiles de redes sociales, registros públicos), el derecho de protección de datos se aplica independientemente de su disponibilidad pública. El RGPD, el UK GDPR, la PDPA, la DPDP Act y la Privacy Act australiana regulan todos ellos el tratamiento de datos personales. La disponibilidad pública puede aportar una base jurídica (interés legítimo conforme al RGPD), pero no elimina las obligaciones de transparencia, minimización de datos y respeto de los derechos individuales. Las reformas de la DUAA de 2025 a la limitación de la finalidad prevista en el artículo 5(1)(b) del UK GDPR otorgan a las organizaciones establecidas en el Reino Unido mayor margen para reutilizar datos personales en el entrenamiento de IA, pero se trata de la divergencia más significativa entre el Reino Unido y la UE desde el Brexit, y no se aplica en las jurisdicciones de la UE.

El scraping de datos personales de acceso público para entrenar IA ha atraído medidas de ejecución: Clearview AI (múltiples jurisdicciones, multas por RGPD/PDPA), medidas de la CNIL contra el entrenamiento con datos personales franceses, investigaciones de la ICO.

Términos de servicio de las plataformas

Muchas fuentes de datos públicos prohíben el scraping o el uso comercial en sus términos de servicio. Las plataformas de redes sociales, los medios de noticias, los foros y las bases de datos suelen restringir la recopilación automatizada de datos. El incumplimiento de los términos de servicio genera responsabilidad contractual incluso cuando los datos subyacentes podrían, por lo demás, estar disponibles legalmente. El caso LinkedIn contra hiQ Labs (Tribunal Supremo de EE. UU., devuelto a instancias inferiores en 2022) demostró esta complejidad: el acceso no equivale a la autorización para todos los usos.

Orientación práctica

No des por hecho que público significa libre de usar para entrenar IA. Para cada fuente de datos: comprueba el estado de los derechos de autor; comprueba si intervienen datos personales; comprueba los términos de la plataforma; comprueba las excepciones de minería de textos y datos de la jurisdicción aplicable; documenta tu base jurídica. Para la mayoría de las organizaciones, el enfoque más seguro para los datos de entrenamiento de IA consiste en: usar conjuntos de datos debidamente licenciados; usar datos sintéticos; usar datos que hayas generado o recopilado con el consentimiento adecuado; y mantener registros detallados de la procedencia de los datos de entrenamiento para fines de auditoría y defensa en litigios.

Fuentes primarias: Oficina de Derechos de Autor de EE. UU. · ICO · CNIL

Lecturas relacionadas