Artikel

Hoe pseudonimisering de privacy van jouw data beschermt

Elke prompt die je naar een LLM stuurt, wordt opgeslagen en gelogd door een externe partij. Pseudonimisering houdt je gevoelige gegevens binnen je eigen omgeving.

Artific

Een hand raakt een doorzichtig scherm aan met schildjes en sloten als beveiligingssymbolen.

Dat voelt onschuldig bij een recept of trivia-vraag, maar wordt een serieus risico zodra je werkt met klantdata, persoonsgegevens of bedrijfsgevoelige informatie. Juridische afspraken bieden geen technische garantie: je data is de deur uit en je verliest er controle over.

Wil je LLM’s veilig inzetten, dan moet je gevoelige informatie beschermen vóórdat je deze verstuurt. Anonimiseren en pseudonimiseren zijn daarbij geen luxe, maar een noodzakelijke eerste stap.

Waarom anonimiseren niet werkt

Oké, dus je wilt je data beschermen voordat die de deur uit gaat. De meest voor de hand liggende oplossing: anonimiseren. Gewoon alles weglakken. Klinkt logisch. Tot je het probeert.

Neem nou bijvoorbeeld deze zin.

Jan klaagde dat zijn bestelling #12345 beschadigd aankwam

Geanonimiseerd wordt dat:

[VERWIJDERD] klaagde dat [VERWIJDERD] beschadigd aankwam

Succes ermee. De LLM heeft geen idee waar dit over gaat. Geen context. Geen bruikbaar antwoord.

Onderzoek laat zien: dit soort generieke maskering veroorzaakt enorm veel kwaliteitsverlies. Je AI wordt effectief onbruikbaar.

Maar er is een alternatief: pseudonimisering

Hoe dat werkt? Neem hetzelfde voorbeeld als bij anonimisering. In plaats van de gevoelige data te verwijderen, vervangen wij deze door een context gerelateerd woord en nummer. Gepseudonimiseerd wordt dat dan:

PERSOON_1 klaagde dat zijn bestelling BESTELLING_1 beschadigd aankwam

De LLM snapt dat PERSOON_1 een persoon is en dat BESTELLING_1 een bestelnummer is. De context blijft intact. De mapping, wie PERSOON_1 echt is, behandelen we apart, buiten het LLM om.

Het gevolg, de context blijft intact zodat de LLMs hiermee om kunnen gaan en privacygevoelige informatie nooit wordt verzonden naar de LLMs.

Kwaliteitsverlies? Die is er, maar gering. Onze tests tonen aan dat het kwaliteitsverlies slechts 8% bedraagt. En dit kwaliteitsverlies wordt steeds minder.

Waarom namen pseudonimiseren het lastigste is

E-mailadressen herkennen is makkelijk. Zoek het @-teken, check of er een geldige domeinnaam achter staat en klaar.

Telefoonnummers? Regex. IBAN-nummers? Regex plus checksum. BSN? Idem, geen probleem.

Maar namen?

Is “Bas Viool” een naam? Of wat dacht je van “Hope”? “Guy”? “Brouwer”? Namen volgen geen patroon. Ze zijn context-afhankelijk. “Apple” kan een bedrijf zijn, een vrucht, of de dochter van Gwyneth Paltrow.

Daarom hebben wij namen als eerste aangepakt. Als je namen kunt detecteren, het moeilijkste probleem, dan stelt de rest niet zoveel meer voor.

Data die je niet verstuurt, kan niet lekken

Bij Artific hebben we gekozen voor een aanpak van token-gebaseerde pseudonimisering. De persoonsgegevens verlaten nooit je omgeving. Alleen de tokens gaan naar de LLM, de mapping blijft van jou.

De EDPB Richtlijnen van januari 2025 valideren precies deze aanpak. Onze huidige oplossing presteert op industry benchmark niveau. Maar we zijn nog niet klaar. We onderzoeken nu hoe we eigen gespecialiseerde modellen kunnen trainen, zodat onze klanten dit kunnen gebruiken zonder kwaliteitsverlies, volledig onder eigen beheer.

Veiligheid is een doorlopend proces

Inmiddels hebben wij pseudonimiseren binnen het Artific AI-platform geïmplementeerd en daarmee een grote stap gezet in het beschermen van jouw privacy. Biedt deze oplossing honderd procent garantie dat jouw data niet gelekt kan worden? Hoewel het een enorme verbetering is ten opzichte van andere AI-oplossingen in de markt, is dit nog geen waterdichte oplossing.

Tegelijk verandert de wereld van AI, wetgeving en dataveiligheid razendsnel. Daarom hebben we een dedicated team dat deze ontwikkelingen op de voet volgt en continu onderzoekt hoe we LLM’s veilig en verantwoord beschikbaar kunnen blijven stellen. Echte veiligheid is geen eindpunt, maar een doorlopend proces.

Over Artific

Het in Nederland ontwikkelde AI-platform Artific is ontworpen met als uitgangspunt Security and Privacy by Design. Artific is volledig platform- en taalmodelonafhankelijk en we ondersteunen al meer dan 35 taalmodelvarianten. Wij bouwen virtuele medewerkers die veilig en betrouwbaar zijn. Getest door ethical hackers.

Dit artikel is geschreven door Erik van der Pluijm, research lead van het Artific GenAI Research Lab. Wij onderzoeken actief de mogelijkheden én risico’s van generatieve AI voor zakelijke toepassingen. Heb je vragen of wil je sparren over AI-implementatie in jouw organisatie? Neem contact met ons op.

Terug naar het kenniscentrum