Qué pasa con tus datos cuando usas IA

Enrique Sobrino Navarro

Socio fundador y CEO, IAintegraciones

Resumen

Explicamos dónde viajan y se almacenan tus datos al usar IA en tu pyme, quién puede acceder y cómo comprobarlo con preguntas concretas al proveedor.

Palabras clave: protección de datos, RGPD, subencargados, transferencias internacionales, retención.

Introducción

Cuando alguien pregunta “¿dónde acaban los datos que metemos en esa herramienta de IA?”, la mayoría de empresas no sabe responder con claridad (Agencia Española de Protección de Datos, 2025).
No es por mala fe, sino porque la decisión de “qué herramienta usar” se suele tomar por funcionalidad, precio o urgencia, y la arquitectura técnica queda oculta tras términos comerciales como “nube segura”, “IA privada” o “entorno corporativo” (Organización para la Cooperación y el Desarrollo Económicos, 2025).

El resultado es que muchas pymes ya están procesando presupuestos, contratos o historiales de clientes en sistemas de IA sin tener claro tres cuestiones básicas: dónde se procesan físicamente esos datos, durante cuánto tiempo se conservan y quién puede acceder en la práctica (Agencia Española de Protección de Datos, 2020a; National Institute of Standards and Technology, 2023).
Responder a estas preguntas no exige ser técnico ni jurista, pero sí entender cómo están construidas las principales arquitecturas de IA que una pyme puede contratar, y cómo esas decisiones técnicas se traducen en riesgos y garantías concretas.

En las siguientes secciones se describe ese mapa de arquitecturas, se analizan los puntos críticos que conviene preguntar a cualquier proveedor y se comentan errores frecuentes que vemos en pymes españolas y europeas, para terminar con criterios prácticos de decisión proporcional según el tipo de dato (Agencia Española de Protección de Datos, 2026; Supervisor Europeo de Protección de Datos, 2025).

El mapa de arquitecturas de IA

Servicios globales accesibles por interfaz o API

La primera categoría son los servicios de IA ofrecidos por grandes proveedores globales, a los que se accede vía web, plugins ofimáticos o integración por API (Organización para la Cooperación y el Desarrollo Económicos, 2025).
En estos casos, la empresa usuaria no controla la infraestructura: envía peticiones a endpoints expuestos en Internet y el proveedor decide dónde se ejecuta el modelo y en qué región se almacenan logs, copias de seguridad y datos auxiliares (National Institute of Standards and Technology, 2023).

En la práctica, esto implica que el dato puede viajar fuera del Espacio Económico Europeo, incluso si la empresa firmó con la filial europea del proveedor, porque muchas plataformas usan centros de datos distribuidos y redes de entrega globales (Supervisor Europeo de Protección de Datos, 2025).
Además del contenido principal, se generan registros técnicos con información de la cuenta, dirección IP, metadatos de la petición y, en ocasiones, fragmentos del propio texto enviado, que pueden conservarse más tiempo que la conversación visible para el usuario (Agencia Española de Protección de Datos, 2020b).

Servicios con garantía de procesamiento en la Unión Europea

La segunda categoría son servicios de IA que se comercializan con garantías explícitas de procesamiento en la UE, ya sea en centros de datos únicos o en regiones “UE only” (Agencia Española de Protección de Datos, 2025).
Aquí el proveedor se compromete contractualmente a que el tratamiento principal se realice en infraestructuras ubicadas en la Unión y a limitar las transferencias internacionales a supuestos concretos, normalmente con cláusulas y mecanismos adicionales.

En la práctica, esto reduce el riesgo de transferencias sin control, pero no lo elimina: el modelo puede estar desplegado en la UE mientras los sistemas de soporte, monitorización, soporte técnico o copias de seguridad utilicen subencargados en otras jurisdicciones (Organización para la Cooperación y el Desarrollo Económicos, 2025).
También hay que considerar que muchos proveedores europeos utilizan plataformas de nube global como base, de modo que la garantía real depende de cómo hayan configurado regiones, servicios gestionados y listas de subprocesadores (National Institute of Standards and Technology, 2023).

Modelos desplegados en infraestructura propia o de un proveedor europeo

La tercera categoría son los modelos que la propia organización despliega en su infraestructura, o en la de un proveedor europeo que opera como mero hospedaje técnico (Agencia Española de Protección de Datos, 2026).
Aquí la pyme controla el lugar físico de los servidores, la red y las herramientas de almacenamiento; puede, por ejemplo, decidir que todo el procesamiento se haga en un centro de datos concreto en España o en otro país de la UE.

En esta situación, la ubicación del dato es más transparente: se limita al ámbito de la infraestructura propia o contratada, siempre que no se utilicen servicios externos para tareas como monitorización, soporte remoto o entrenamiento con datos reales (Agencia Española de Protección de Datos, 2020b).
Sin embargo, esta opción traslada a la pyme la responsabilidad operativa: gestionar actualizaciones de modelos, seguridad, copias de seguridad, retención de logs y políticas de acceso, con un coste real de operación y mantenimiento que a menudo se subestima (National Institute of Standards and Technology, 2023).

Por dónde viaja realmente el dato

Procesamiento versus almacenamiento

En cualquier arquitectura conviene diferenciar entre dónde se procesa el dato y dónde se almacena, porque no siempre coinciden (Agencia Española de Protección de Datos, 2020a).
Un texto de cliente puede procesarse en memoria en un nodo de cálculo, mientras que los registros de uso, las trazas de errores o las copias de seguridad se almacenan en servicios de base de datos, colas o almacenamiento de objetos ubicados en otra región.

Las guías de protección de datos por defecto insisten en que el responsable debe decidir, para cada fase del tratamiento, qué datos son estrictamente necesarios, dónde se almacenan y durante cuánto tiempo, incluyendo las copias y los entornos de prueba (Agencia Española de Protección de Datos, 2020a).
En sistemas de IA esto se traduce en políticas claras sobre qué se guarda de cada interacción: solo metadatos mínimos, texto parcial pseudonimizado o el contenido completo, y en qué sistemas reside esa información.

Retención de conversaciones, logs y copias

La retención no se limita a las “conversaciones” visibles para el usuario: los sistemas de IA generan múltiples capas de memoria y registro (Agencia Española de Protección de Datos, 2026).
Puede haber memoria de trabajo del agente, almacenamiento de contexto para mejorar la experiencia, registros de auditoría de acceso a datos internos y logs técnicos para depurar y monitorizar el modelo.

Las recomendaciones europeas sobre IA generativa en administraciones públicas proponen fijar plazos estrictos de conservación, diferenciando entre registros necesarios para evidencia y seguridad, y contenido que debe borrarse o anonimizarse una vez cumplida la finalidad (Agencia Española de Protección de Datos, 2025).
El marco de riesgo de NIST refuerza la idea de tratar los logs como evidencia primero y como telemetría después, documentando qué se retiene, por cuánto tiempo y con qué controles de acceso (National Institute of Standards and Technology, 2023).

Uso de contenido para entrenar o mejorar modelos

Otro punto clave es si el contenido introducido por la empresa se utiliza para entrenar o mejorar modelos (Agencia Española de Protección de Datos, 2020b).
En servicios globales, la opción de “usar datos del cliente para mejorar el servicio” suele implicar que parte de las entradas se incorporan a conjuntos de datos de entrenamiento, aunque sea de forma agregada o pseudonimizada.

Las orientaciones del Supervisor Europeo de Protección de Datos sobre IA generativa subrayan que cualquier reutilización de datos para fines de entrenamiento o mejora debe estar claramente documentada, con finalidades, categorías de datos y plazos de conservación definidos (Supervisor Europeo de Protección de Datos, 2025).
En entornos autoalojados, la organización puede decidir no usar datos reales para reentrenar el modelo, pero sí conservar muestras anonimizadas para pruebas, lo que también debe figurar en la documentación interna y en la información a los interesados (Agencia Española de Protección de Datos, 2020b).

Acceso de terceros y subencargados

Por último, no basta con saber qué hace el proveedor principal: hay que considerar la cadena de subencargados que presta servicios de infraestructura, soporte, monitorización y seguridad (Agencia Española de Protección de Datos, 2026).
Cada uno de ellos puede tener acceso técnico a registros, copias de seguridad o entornos de prueba donde se alojan datos, aunque nunca vean la interfaz de usuario.

Las guías sobre arquitecturas agenticas insisten en definir políticas de acceso a la información de la organización, especificando qué servicios y repositorios puede consultar cada componente del sistema y registrando esos accesos de forma trazable (Agencia Española de Protección de Datos, 2026).
Esto incluye el control de accesos por parte de equipos de soporte remoto, operaciones de mantenimiento en la nube y auditorías externas, que deben operar sobre datos minimizados o anonimizados siempre que sea posible.

Qué preguntar al proveedor y cómo comprobar

Dónde se procesa y dónde se almacena

La primera pregunta no debería ser “¿cumplís el RGPD?”, sino “¿en qué países o regiones se procesan y almacenan los datos de mis casos de uso concretos?” (Agencia Española de Protección de Datos, 2025).
Conviene pedir un mapa claro: región de ejecución del modelo, servicios de almacenamiento utilizados, ubicación de copias de seguridad y de los sistemas de monitorización.

Las guías de protección de datos por defecto recomiendan documentar dónde se almacena y procesa cada categoría de dato, si es local o remoto, y qué procesadores o países intervienen (Agencia Española de Protección de Datos, 2020a).
En la práctica, esto se traduce en exigir al proveedor una lista actualizada de regiones activas y de subencargados relevantes para el servicio contratado, no solo un diagrama genérico de marketing.

Plazos de retención de conversaciones y registros

La segunda cuestión es “¿qué se guarda de cada interacción y durante cuánto tiempo?” (Agencia Española de Protección de Datos, 2026).
Hay que distinguir entre conversaciones, registros de actividad del usuario, logs técnicos y copias de seguridad, porque cada uno puede tener plazos y finalidades diferentes.

La política de IA generativa de la AEPD propone fijar tiempos máximos de retención y criterios de borrado por categorías, evitando conservar contenido innecesario y limitando los registros a la información imprescindible para supervisión y evidencia (Agencia Española de Protección de Datos, 2025).
A la hora de comprobarlo, es útil pedir ejemplos de configuraciones reales, informes de auditoría y, cuando sea posible, ejecutar pruebas de uso y observar qué eventos aparecen en los paneles de monitorización y trazas exportables (National Institute of Standards and Technology, 2023).

Uso de datos para entrenamiento y cómo desactivarlo

La tercera pregunta es “¿se utilizan mis datos para entrenar o afinar modelos, y cómo puedo desactivar ese uso?” (Supervisor Europeo de Protección de Datos, 2025).
En muchos servicios, esta opción se controla mediante banderas de configuración, contratos específicos o planes de servicio diferenciados.

Las orientaciones europeas recomiendan separar claramente el uso de datos para prestación del servicio del uso para entrenamiento o mejora, de modo que la empresa pueda optar por no contribuir con sus datos sin perder funciones esenciales (Supervisor Europeo de Protección de Datos, 2025).
Comprobarlo implica revisar las condiciones de servicio, las opciones de configuración disponibles en la consola y, en su caso, solicitar confirmación escrita de que el proveedor no utilizará los datos de producción para entrenamiento más allá de lo estrictamente necesario para seguridad y calidad (Agencia Española de Protección de Datos, 2020b).

Lista de subencargados y registros técnicos

Otra pregunta clave es “¿qué subencargados intervienen y qué registros técnicos generan?” (Agencia Española de Protección de Datos, 2026).
La lista debe incluir proveedores de nube, servicios de monitorización, plataformas de soporte y cualquier herramienta que procese datos o metadatos de las operaciones de IA.

La política de contratación de IA generativa de la AEPD destaca la importancia de conocer qué datos técnicos y de uso se recogen (logs, identificadores, telemetría) y cómo se protegen, especialmente cuando intervienen terceros (Agencia Española de Protección de Datos, 2025).
Comprobarlo puede requerir revisar anexos de protección de datos, preguntar por las políticas de registro (“no-log” selectivo, anonimización de contenido) y solicitar muestras de los formatos de log utilizados para ver si incluyen texto de clientes o solo identificadores técnicos (Agencia Española de Protección de Datos, 2026).

Transferencias internacionales y garantías adicionales

Finalmente, hay que preguntar “¿qué transferencias internacionales se realizan y con qué garantías adicionales?” (Organización para la Cooperación y el Desarrollo Económicos, 2025).
Cuando el proveedor está fuera del Espacio Económico Europeo, o utiliza subencargados en terceros países, es necesario conocer los mecanismos que se aplican para proteger los datos y respetar las decisiones de adecuación aplicables.

Las orientaciones del Supervisor Europeo de Protección de Datos ponen el foco en la documentación de roles, almacenamiento, transferencias y medidas de mitigación, especialmente en sistemas de IA generativa usados en instituciones públicas (Supervisor Europeo de Protección de Datos, 2025).
En el ámbito empresarial, esto se traduce en exigir claridad sobre qué datos cruzan fronteras, en qué circunstancias y bajo qué instrumentos jurídicos, y en valorar si determinados datos deberían permanecer en sistemas que no realizan transferencias internacionales (Agencia Española de Protección de Datos, 2020a).

Errores frecuentes en la práctica

Un primer error es dar por hecho que los datos están en Europa únicamente porque el proveedor tiene sede o filial europea (Organización para la Cooperación y el Desarrollo Económicos, 2025).
La realidad técnica es que una misma empresa puede operar centros en múltiples regiones y enrutarlos dinámicamente; la sede no determina la ubicación de los servidores ni de las copias de seguridad.

El segundo error es confundir el cifrado en tránsito con la confidencialidad frente al propio proveedor (Agencia Española de Protección de Datos, 2020a).
Que los datos viajen cifrados entre la pyme y la plataforma no impide que, una vez descifrados en el extremo del proveedor, se almacenen en claro o se consulten para fines de monitorización, entrenamiento o soporte.

El tercer error es no revisar la lista de subencargados, o hacerlo solo al contratar sin seguimiento posterior (Agencia Española de Protección de Datos, 2026).
Las cadenas de suministro digitales evolucionan rápido: un cambio de proveedor de infraestructura o de herramienta de monitorización puede introducir nuevos actores con acceso indirecto a datos y registros.

El cuarto error es asumir que autoalojar un modelo resuelve automáticamente los problemas de ubicación y acceso, sin contar el coste real de operación y mantenimiento (National Institute of Standards and Technology, 2023).
Un despliegue propio mal gestionado, sin políticas claras de logs, copias de seguridad y control de acceso, puede ser más arriesgado que un servicio externo bien configurado.

El quinto error es tratar todos los datos de la empresa con el mismo nivel de exigencia, sin distinguir entre información que puede salir razonablemente de la organización y aquella que no debería hacerlo (Agencia Española de Protección de Datos, 2020b).
Esta confusión lleva tanto a la parálisis (no usar IA para nada) como a la ingenuidad (usar cualquier herramienta con cualquier tipo de dato), cuando lo razonable es graduar las decisiones.

Decidir de forma proporcional según el tipo de dato

La clave no es encontrar la arquitectura “perfecta”, sino decidir de forma proporcional según el tipo de dato y el caso de uso (National Institute of Standards and Technology, 2023).
Información pública, documentación ya publicada o datos agregados pueden tolerar arquitecturas más abiertas, mientras que datos de salud, perfiles de riesgo o incidencias sensibles requieren mayores garantías.

Las guías de la AEPD sobre IA recomiendan analizar el ciclo de vida de cada tratamiento que incorpora IA, identificar en qué fases se manejan datos personales y aplicar minimización y restricciones por defecto en las partes más sensibles (Agencia Española de Protección de Datos, 2020b; Agencia Española de Protección de Datos, 2026).
En la práctica, esto puede implicar mantener ciertos datos en sistemas internos, usar IA externa solo con versiones anonimizadas o pseudonimizadas, y reservar arquitecturas más controladas para procesos críticos.

Las recomendaciones internacionales sobre gobernanza de datos y privacidad señalan que las decisiones técnicas deben estar alineadas con el tipo de impacto posible sobre las personas y sobre la organización (Organización para la Cooperación y el Desarrollo Económicos, 2025).
Cuando los riesgos son altos, puede ser razonable invertir en modelos autoalojados o en servicios europeos con garantías reforzadas; cuando los riesgos son bajos, puede bastar con configurar bien un servicio global, desactivar el entrenamiento con datos del cliente y fijar plazos de retención conservadores.

En todo caso, la decisión final conviene validarla desde la perspectiva jurídica cuando se trata de datos especialmente sensibles o de tratamientos complejos, combinando el análisis técnico de arquitectura con la interpretación profesional del marco normativo (Supervisor Europeo de Protección de Datos, 2025; Agencia Española de Protección de Datos, 2020a).

Referencias

Agencia Española de Protección de Datos [AEPD]. (2020a). Guidelines for Data Protection by Default. https://www.aepd.es/guides/guidelines-for-data-protection-by-default.pdf

Agencia Española de Protección de Datos [AEPD]. (2020b). Tratamientos que incorporan Inteligencia Artificial. Una introducción. https://www.aepd.es/documento/adecuacion-rgpd-ia.pdf

Agencia Española de Protección de Datos [AEPD]. (2025). Política general para el uso de IA generativa en procesos administrativos de la AEPD. https://www.aepd.es/documento/politica-iag-aepd.pdf

Agencia Española de Protección de Datos [AEPD]. (2026). Agentic Artificial Intelligence from the Perspective of Data Protection. https://www.aepd.es/en/guides/agentic-artificial-intelligence.pdf

National Institute of Standards and Technology [NIST]. (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0) (NIST AI 100-1). https://doi.org/10.6028/NIST.AI.100-1

Organización para la Cooperación y el Desarrollo Económicos [OCDE]. (2025). AI, data governance and privacy: Synergies and areas of international co-operation. https://www.oecd.org/en/publications/ai-data-governance-and-privacy_2476b1a4-en.html

Supervisor Europeo de Protección de Datos [SEPD]. (2025). Generative AI and the EUDPR: Orientations for ensuring data protection. https://www.edps.europa.eu/system/files/2025-10/25-10_28_revised_genai_orientations_en.pdf

Más artículos

«Ya le metí IA a mi empresa, y no funcionó…»

Por qué tantos proyectos de inteligencia artificial acaban así aunque la tecnología funcione, y qué se hace distinto cuando sí salen bien.

Read more

Por qué la demo funciona y en producción falla

Las cinco razones por las que un sistema que rinde en la prueba se degrada al conectarlo, y cómo diseñar una prueba que sí prediga el comportamiento real.

Read more

¿Tiene sentido la IA para su empresa?

Cada negocio es diferente. En una primera conversación entendemos su operativa y le decimos honestamente si hay oportunidades reales de automatización, y cuánto podría ahorrar.

Nuestra oficina

  • Andorra la Vella
    Princep Benlloch 66
    AD500, Andorra la Vella