
Bei einem Rezept oder einer Quizfrage wirkt das harmlos, wird aber zum ernsten Risiko, sobald Sie mit Kundendaten, personenbezogenen Daten oder vertraulichen Unternehmensinformationen arbeiten. Vertragliche Vereinbarungen sind keine technische Garantie: Ihre Daten sind aus dem Haus, und Sie verlieren die Kontrolle darüber.
Wer LLMs sicher einsetzen will, muss sensible Informationen schützen, bevor sie verschickt werden. Anonymisieren und Pseudonymisieren sind dabei kein Luxus, sondern ein notwendiger erster Schritt.
Warum Anonymisieren nicht funktioniert
Gut, Sie wollen Ihre Daten also schützen, bevor sie das Haus verlassen. Die naheliegende Lösung: anonymisieren. Einfach alles schwärzen. Klingt logisch. Bis man es ausprobiert.
Nehmen wir zum Beispiel diesen Satz.
Jan beschwerte sich, dass seine Bestellung #12345 beschädigt ankam
Anonymisiert wird daraus:
[ENTFERNT] beschwerte sich, dass [ENTFERNT] beschädigt ankam
Viel Erfolg damit. Das LLM hat keine Ahnung, worum es geht. Kein Kontext. Keine brauchbare Antwort.
Studien zeigen: Diese Art von pauschaler Maskierung kostet enorm viel Qualität. Ihre KI wird praktisch unbrauchbar.
Aber es gibt eine Alternative: Pseudonymisierung
Wie das funktioniert? Nehmen wir dasselbe Beispiel wie beim Anonymisieren. Statt die sensiblen Daten zu entfernen, ersetzen wir sie durch ein Wort, das zum Kontext passt, und eine Nummer. Pseudonymisiert wird daraus:
PERSON_1 beschwerte sich, dass seine Bestellung BESTELLUNG_1 beschädigt ankam
Das LLM versteht, dass PERSON_1 eine Person ist und BESTELLUNG_1 eine Bestellnummer. Der Kontext bleibt erhalten. Die Zuordnung, also wer PERSON_1 wirklich ist, verwalten wir getrennt, außerhalb des LLM.
Die Folge: Der Kontext bleibt erhalten, sodass die LLMs damit arbeiten können, und datenschutzrelevante Informationen werden nie an die LLMs geschickt.
Qualitätsverlust? Den gibt es, aber er ist gering. Unsere Tests zeigen, dass der Qualitätsverlust nur 8 % beträgt. Und er wird immer kleiner.
Warum Namen am schwierigsten zu pseudonymisieren sind
E-Mail-Adressen zu erkennen ist einfach. Das @-Zeichen suchen, prüfen, ob dahinter ein gültiger Domainname steht, fertig.
Telefonnummern? Regex. IBANs? Regex plus Prüfsumme. Die niederländische Bürgerservicenummer (BSN)? Ebenso, kein Problem.
Aber Namen?
Ist „Bas Viool“ ein Name? Oder was ist mit „Hope“? „Guy“? „Brouwer“? Namen folgen keinem Muster. Sie hängen vom Kontext ab. „Apple“ kann ein Unternehmen sein, eine Frucht oder die Tochter von Gwyneth Paltrow.
Deshalb haben wir uns zuerst die Namen vorgenommen. Wer Namen erkennen kann, das schwierigste Problem, für den ist der Rest keine große Sache mehr.
Daten, die Sie nicht verschicken, können nicht durchsickern
Bei Artific haben wir uns für eine tokenbasierte Pseudonymisierung entschieden. Die personenbezogenen Daten verlassen nie Ihre Umgebung. Nur die Tokens gehen an das LLM, die Zuordnung bleibt bei Ihnen.
Die EDPB-Leitlinien vom Januar 2025 bestätigen genau diesen Ansatz. Unsere aktuelle Lösung liegt auf dem Niveau der Branchen-Benchmarks. Aber wir sind noch nicht fertig. Wir untersuchen jetzt, wie wir eigene spezialisierte Modelle trainieren können, damit unsere Kunden dies ohne Qualitätsverlust nutzen können, vollständig unter eigener Kontrolle.
Sicherheit ist ein fortlaufender Prozess
Inzwischen haben wir die Pseudonymisierung in die Artific AI Platform eingebaut und damit einen großen Schritt zum Schutz Ihrer Privatsphäre gemacht. Bietet diese Lösung eine hundertprozentige Garantie, dass Ihre Daten nicht durchsickern können? Sie ist zwar eine enorme Verbesserung gegenüber anderen KI-Lösungen auf dem Markt, aber noch keine wasserdichte Lösung.
Gleichzeitig verändert sich die Welt der KI, der Gesetzgebung und der Datensicherheit rasend schnell. Deshalb haben wir ein eigenes Team, das diese Entwicklungen genau verfolgt und laufend untersucht, wie wir LLMs weiterhin sicher und verantwortungsvoll bereitstellen können. Echte Sicherheit ist kein Endpunkt, sondern ein fortlaufender Prozess.
Über Artific
Die in den Niederlanden entwickelte KI-Plattform Artific wurde nach dem Grundsatz Security and Privacy by Design entworfen. Artific ist vollständig plattform- und sprachmodellunabhängig, und wir unterstützen bereits mehr als 35 Sprachmodellvarianten. Wir bauen virtuelle Mitarbeiter, die sicher und zuverlässig sind. Von Ethical Hackern getestet.
Dieser Artikel wurde von Erik van der Pluijm geschrieben, Research Lead des Artific GenAI Research Lab. Wir erforschen aktiv die Möglichkeiten und Risiken generativer KI für geschäftliche Anwendungen. Haben Sie Fragen, oder möchten Sie sich über die Einführung von KI in Ihrer Organisation austauschen? Nehmen Sie Kontakt mit uns auf.