
Cela paraît anodin pour une recette ou une question de quiz, mais cela devient un risque sérieux dès que vous travaillez avec des données clients, des données personnelles ou des informations sensibles pour l’entreprise. Les engagements juridiques n’offrent aucune garantie technique : vos données sont parties et vous en perdez le contrôle.
Si vous voulez utiliser les LLM en toute sécurité, vous devez protéger les informations sensibles avant de les envoyer. L’anonymisation et la pseudonymisation ne sont pas un luxe, mais une première étape indispensable.
Pourquoi l’anonymisation ne fonctionne pas
D’accord, vous voulez donc protéger vos données avant qu’elles ne partent. La solution la plus évidente : anonymiser. Tout simplement tout masquer. Cela paraît logique. Jusqu’à ce que vous essayiez.
Prenons par exemple cette phrase.
Jan s’est plaint que sa commande #12345 était arrivée endommagée
Une fois anonymisée, elle devient :
[SUPPRIMÉ] s’est plaint que [SUPPRIMÉ] était arrivée endommagée
Bonne chance. Le LLM n’a aucune idée de ce dont il s’agit. Aucun contexte. Aucune réponse utile.
La recherche le montre : ce type de masquage générique entraîne une énorme perte de qualité. Votre IA devient en pratique inutilisable.
Mais il existe une alternative : la pseudonymisation
Comment cela fonctionne-t-il ? Reprenons le même exemple que pour l’anonymisation. Au lieu de supprimer les données sensibles, nous les remplaçons par un mot lié au contexte et un numéro. Une fois pseudonymisée, la phrase devient :
PERSONNE_1 s’est plaint que sa commande COMMANDE_1 était arrivée endommagée
Le LLM comprend que PERSONNE_1 est une personne et que COMMANDE_1 est un numéro de commande. Le contexte reste intact. La correspondance, c’est-à-dire qui est réellement PERSONNE_1, nous la gérons séparément, en dehors du LLM.
Résultat : le contexte reste intact, les LLM peuvent donc travailler avec, et les informations sensibles ne sont jamais envoyées aux LLM.
Une perte de qualité ? Il y en a une, mais elle est faible. Nos tests montrent qu’elle n’est que de 8 %. Et elle diminue sans cesse.
Pourquoi pseudonymiser les noms est le plus difficile
Reconnaître une adresse e-mail est facile. Cherchez l’arobase, vérifiez qu’un nom de domaine valide suit, et c’est réglé.
Les numéros de téléphone ? Une regex. Les IBAN ? Une regex plus une somme de contrôle. Le BSN, le numéro d’identification néerlandais ? Idem, aucun problème.
Mais les noms ?
« Bas Viool » est-il un nom ? Et que dites-vous de « Hope » ? « Guy » ? « Brouwer » ? Les noms ne suivent aucun schéma. Ils dépendent du contexte. « Apple » peut être une entreprise, un fruit ou la fille de Gwyneth Paltrow.
C’est pourquoi nous nous sommes attaqués aux noms en premier. Si vous savez détecter les noms, le problème le plus difficile, le reste n’est plus grand-chose.
Des données que vous n’envoyez pas ne peuvent pas fuiter
Chez Artific, nous avons choisi une approche de pseudonymisation par jetons. Les données personnelles ne quittent jamais votre environnement. Seuls les jetons partent vers le LLM, la correspondance reste la vôtre.
Les lignes directrices de l’EDPB de janvier 2025 valident précisément cette approche. Notre solution actuelle atteint le niveau des benchmarks du secteur. Mais nous n’avons pas fini. Nous étudions maintenant comment entraîner nos propres modèles spécialisés, pour que nos clients puissent l’utiliser sans perte de qualité, entièrement sous leur propre contrôle.
La sécurité est un processus continu
Nous avons désormais mis en œuvre la pseudonymisation dans la plateforme IA d’Artific, et fait ainsi un grand pas dans la protection de votre vie privée. Cette solution offre-t-elle une garantie à cent pour cent que vos données ne peuvent pas fuiter ? Même si c’est une nette amélioration par rapport aux autres solutions d’IA du marché, ce n’est pas encore une solution étanche.
Dans le même temps, le monde de l’IA, de la législation et de la sécurité des données évolue à toute vitesse. C’est pourquoi une équipe dédiée suit ces évolutions de près et cherche en permanence comment continuer à mettre les LLM à disposition de manière sûre et responsable. La vraie sécurité n’est pas un point d’arrivée, mais un processus continu.
À propos d’Artific
Développée aux Pays-Bas, la plateforme IA d’Artific est conçue sur le principe du Security and Privacy by Design. Artific est entièrement indépendante des plateformes et des modèles de langage, et nous prenons déjà en charge plus de 35 variantes de modèles de langage. Nous construisons des collaborateurs virtuels sûrs et fiables. Testée par des hackers éthiques.
Cet article a été écrit par Erik van der Pluijm, research lead de l’Artific GenAI Research Lab. Nous étudions activement les possibilités et les risques de l’IA générative pour les usages professionnels. Vous avez des questions ou vous voulez échanger sur la mise en œuvre de l’IA dans votre organisation ? Contactez-nous.