Artículo

Cómo la seudonimización protege la privacidad de tus datos

Cada prompt que envías a un LLM lo guarda y registra un tercero. La seudonimización mantiene tus datos sensibles dentro de tu propio entorno.

Artific

Una mano toca una pantalla transparente con escudos y candados como símbolos de seguridad.

Parece inofensivo cuando se trata de una receta o de una pregunta de cultura general, pero se convierte en un riesgo serio en cuanto trabajas con datos de clientes, datos personales o información sensible de la empresa. Los acuerdos jurídicos no ofrecen una garantía técnica: tus datos ya han salido por la puerta y pierdes el control sobre ellos.

Si quieres usar LLM de forma segura, tienes que proteger la información sensible antes de enviarla. Anonimizar y seudonimizar no son un lujo, sino un primer paso imprescindible.

Por qué anonimizar no funciona

Vale, quieres proteger tus datos antes de que salgan por la puerta. La solución más obvia: anonimizar. Tachar todo sin más. Suena lógico. Hasta que lo pruebas.

Toma, por ejemplo, esta frase.

Juan se quejó de que su pedido #12345 llegó dañado

Anonimizada, queda así:

[ELIMINADO] se quejó de que [ELIMINADO] llegó dañado

Suerte con eso. El LLM no tiene ni idea de qué va esto. Sin contexto. Sin una respuesta útil.

La investigación lo demuestra: este tipo de enmascaramiento genérico provoca una enorme pérdida de calidad. Tu IA queda, en la práctica, inservible.

Pero hay una alternativa: la seudonimización

¿Cómo funciona? Toma el mismo ejemplo que con la anonimización. En lugar de eliminar los datos sensibles, los sustituimos por una palabra relacionada con el contexto y un número. Seudonimizada, la frase queda así:

PERSONA_1 se quejó de que su pedido PEDIDO_1 llegó dañado

El LLM entiende que PERSONA_1 es una persona y que PEDIDO_1 es un número de pedido. El contexto se mantiene intacto. La correspondencia, quién es en realidad PERSONA_1, la gestionamos aparte, fuera del LLM.

El resultado: el contexto se mantiene intacto, de modo que los LLM pueden trabajar con él, y la información sensible para la privacidad nunca se envía a los LLM.

¿Pérdida de calidad? La hay, pero pequeña. Nuestras pruebas muestran que la pérdida de calidad es de solo un 8 %. Y cada vez es menor.

Por qué seudonimizar nombres es lo más difícil

Reconocer direcciones de correo electrónico es fácil. Buscas la arroba, compruebas que detrás haya un nombre de dominio válido y listo.

¿Números de teléfono? Regex. ¿Números IBAN? Regex más suma de control. ¿BSN (el número de identificación personal neerlandés)? Igual, ningún problema.

Pero ¿los nombres?

¿Es “Bas Viool” un nombre? ¿Y qué me dices de “Hope”? ¿“Guy”? ¿“Brouwer”? Los nombres no siguen ningún patrón. Dependen del contexto. “Apple” puede ser una empresa, una fruta o la hija de Gwyneth Paltrow.

Por eso empezamos por los nombres. Si eres capaz de detectar nombres, el problema más difícil, el resto ya no tiene tanto misterio.

Los datos que no envías no se pueden filtrar

En Artific hemos optado por un enfoque de seudonimización basada en tokens. Los datos personales nunca salen de tu entorno. Solo los tokens van al LLM; la correspondencia sigue siendo tuya.

Las directrices del CEPD de enero de 2025 validan precisamente este enfoque. Nuestra solución actual rinde al nivel de los benchmarks del sector. Pero aún no hemos terminado. Ahora estamos investigando cómo entrenar modelos especializados propios, para que nuestros clientes puedan usar esto sin pérdida de calidad y totalmente bajo su propio control.

La seguridad es un proceso continuo

Ya hemos implementado la seudonimización en la plataforma de IA de Artific y, con ello, hemos dado un gran paso en la protección de tu privacidad. ¿Garantiza esta solución al cien por cien que tus datos no puedan filtrarse? Aunque supone una mejora enorme frente a otras soluciones de IA del mercado, todavía no es una solución infalible.

Al mismo tiempo, el mundo de la IA, la legislación y la seguridad de los datos cambia a toda velocidad. Por eso tenemos un equipo dedicado que sigue de cerca estos avances e investiga continuamente cómo podemos seguir ofreciendo LLM de forma segura y responsable. La seguridad real no es un punto final, sino un proceso continuo.

Sobre Artific

La plataforma de IA Artific, desarrollada en los Países Bajos, está diseñada con la Security and Privacy by Design como punto de partida. Artific es totalmente independiente de la plataforma y del modelo de lenguaje, y ya admitimos más de 35 variantes de modelos de lenguaje. Construimos empleados virtuales seguros y fiables. Probado por hackers éticos.

Este artículo lo ha escrito Erik van der Pluijm, research lead del Artific GenAI Research Lab. Investigamos activamente las posibilidades y los riesgos de la IA generativa para aplicaciones empresariales. ¿Tienes preguntas o quieres contrastar ideas sobre la implantación de la IA en tu organización? Ponte en contacto con nosotros.

Volver al centro de conocimiento