Anonymisierung

Daten vor ChatGPT anonymisieren: Methoden, Grenzen und bewährte Praktiken

Genügt es, einen Namen durch einen Platzhalter zu ersetzen, um zu „anonymisieren“? Im Sinne der DSGVO nicht. Dieser Leitfaden unterscheidet Anonymisierung und Pseudonymisierung, listet die zu entfernenden Daten auf und vergleicht die Methoden ehrlich, von der manuellen Durchsicht bis zum Werkzeug auf dem Gerät.

Veröffentlicht am Aktualisiert am 9 Min. LesezeitVon der Redaktion Tacite-IA

Inhalt
  1. Warum Sie anonymisieren sollten, bevor Sie einen Text an eine KI senden
  2. Anonymisierung oder Pseudonymisierung: was die DSGVO sagt
  3. Was Sie vor ChatGPT entfernen sollten
  4. Vier Methoden und ihre Grenzen
  5. Wie Tacite-IA vorgeht, auf dem Gerät
  6. Bewährte Praktiken im Überblick
  7. Häufige Fragen
  8. Quellen

„Ich habe den Namen entfernt, also ist es anonym.“ Der Satz beruhigt, stimmt aber selten. Bevor sie einen Kundenbrief, eine Gehaltstabelle oder ein Protokoll an ChatGPT oder einen anderen Assistenten senden, entfernen viele Beschäftigte, was ihnen sensibel erscheint. Das ist ein guter Reflex. Man muss aber wissen, was das Recht unter „anonym“ versteht, welche Daten zu entfernen sind und was jede Methode tatsächlich schützt. Dieser Leitfaden ordnet das mit Quellen ein, ohne mehr zu versprechen, als die Werkzeuge leisten können.

Warum Sie anonymisieren sollten, bevor Sie einen Text an eine KI senden

Ein Online-KI-Assistent verarbeitet den eingegebenen Text und angehängte Dateien auf den Servern seines Anbieters. Je nach Tarif und Einstellungen werden diese Inhalte eine Zeit lang gespeichert und können bei Verbraucherdiensten zur Verbesserung der Modelle dienen. Auf der Seite zu seinen Verbraucherdiensten bittet OpenAI übrigens darum, keine sensiblen Informationen einzugeben, die man nicht geprüft oder verwendet sehen möchte.6 Diese Regeln stellen wir Tarif für Tarif in unserem Artikel darüber dar, was mit in ChatGPT eingegebenen personenbezogenen Daten geschieht.

Für das Unternehmen geht es zuerst um das Recht. Die DSGVO verlangt, dass personenbezogene Daten „dem Zweck angemessen und erheblich sowie auf das notwendige Maß beschränkt“ sind (Grundsatz der Datenminimierung, Artikel 5).1 Die meisten Aufgaben, die man einer KI anvertraut, etwa umformulieren, übersetzen, zusammenfassen oder gliedern, müssen aber gar nicht wissen, um wen es geht. Die französische Datenschutzbehörde CNIL empfiehlt zudem, die Nutzung generativer KI zu regeln und festzulegen, welche Daten dort nicht eingegeben werden dürfen.7

Die Nachricht geht unverändert hinaus: Name, IBAN und Gesundheitsangabe landen beim Anbieter, der sie nach den Regeln des genutzten Tarifs verarbeitet und speichert.

Dieselbe Nachricht, unverändert gesendet oder nachdem die Daten auf dem Gerät ersetzt wurden. Fiktive Daten.

Anonymisierung oder Pseudonymisierung: was die DSGVO sagt

Die beiden Begriffe werden oft gleichbedeutend verwendet. Sie meinen aber nicht dasselbe, und der Unterschied hat unmittelbare rechtliche Folgen.

Pseudonymisierung: Die Daten bleiben personenbezogen

Die DSGVO definiert Pseudonymisierung als eine Verarbeitung, durch die die Daten ohne Hinzuziehung zusätzlicher Informationen nicht mehr einer bestimmten Person zugeordnet werden können, sofern diese Informationen gesondert aufbewahrt und durch technische und organisatorische Maßnahmen geschützt werden (Artikel 4 Nummer 5).1 Wer „Claire Dupont“ durch „[NAME_1]“ ersetzt und irgendwo die Zuordnungstabelle behält, bewegt sich typischerweise in dieser Kategorie.

Erwägungsgrund 26 ist eindeutig: Pseudonymisierte Daten, die durch Heranziehung zusätzlicher Informationen einer Person zugeordnet werden könnten, bleiben Informationen über eine identifizierbare Person.1 Die DSGVO gilt also weiter. Der Europäische Datenschutzausschuss (EDSA) hat dazu Leitlinien veröffentlicht, die am 16. Januar 2025 in einer Fassung zur öffentlichen Konsultation angenommen wurden und den Nutzen der Pseudonymisierung als Schutzmaßnahme darlegen.3 Die CNIL fasst es unmissverständlich zusammen: Pseudonymisierte Daten bleiben personenbezogen, und der Vorgang ist umkehrbar, anders als die Anonymisierung.2

Anonymisierung: eine unumkehrbare Umwandlung

Umgekehrt stellt derselbe Erwägungsgrund 26 klar, dass die Verordnung nicht für anonyme Informationen gilt, also für Informationen, die sich nicht auf eine identifizierte oder identifizierbare Person beziehen, oder die so anonymisiert wurden, dass die Person nicht mehr identifiziert werden kann.1 Um das zu beurteilen, sind alle Mittel zu berücksichtigen, die nach allgemeinem Ermessen wahrscheinlich genutzt werden, um die Person zu identifizieren, wobei insbesondere die Kosten, der Zeitaufwand und die verfügbare Technologie zählen.1

Für die CNIL muss die Anonymisierung jede Identifizierung der Person mit welchen Mitteln auch immer praktisch unmöglich machen, und zwar unumkehrbar.2 Die europäischen Datenschutzbehörden schlagen in ihrer Stellungnahme vom 10. April 2014 zu Anonymisierungstechniken drei Kriterien zur Bewertung vor: das Herausgreifen (lässt sich eine Person noch isolieren?), die Verknüpfbarkeit (lassen sich Daten über sie miteinander verbinden?) und die Inferenz (lässt sich eine Information über sie ableiten?).4

Was Sie vor ChatGPT entfernen sollten

Die Liste hängt von der Branche ab, doch einige Kategorien tauchen überall auf.

  • Identität und Kontaktdaten: Vor- und Nachnamen, Postanschriften, E-Mail-Adressen, Telefonnummern, Kundenkennungen.
  • Nationale Kennnummern, allen voran in Frankreich die Sozialversicherungsnummer (NIR): Die CNIL erinnert daran, dass sie nur in ganz bestimmten Fällen verwendet werden darf, meist im Zusammenhang mit der sozialen Sicherung.5 Dasselbe gilt für Reisepass- oder Personalausweisnummern.
  • Bankdaten: IBAN, Kartennummern, Lastschriftreferenzen.
  • Die besonderen Kategorien personenbezogener Daten nach Artikel 9 DSGVO: Gesundheit, politische Meinungen, religiöse Überzeugungen, Gewerkschaftszugehörigkeit, sexuelle Orientierung, Herkunft.1 Eine in einer Personal-E-Mail erwähnte Krankschreibung gehört dazu.
  • Technische Geheimnisse: Passwörter, API-Schlüssel, Zugriffstoken, Verbindungszeichenfolgen. Das sind keine personenbezogenen Daten, doch ihr Abfluss kann den Zugang zu ganzen Systemen öffnen. Entwickler sind mit Coding-Assistenten besonders exponiert (siehe unseren Leitfaden, wie Sie Secrets in Claude Code und Cursor schützen).
  • Der Kontext. Das ist die häufigste Falle. „Die Finanzchefin unserer Niederlassung in Lyon, seit März krankgeschrieben“ identifiziert eine Person, ohne ihren Namen zu nennen. Funktion, Ort, ein Datum und ein Ereignis genügen oft.
personal-nachricht.txtAnonymisierte Fassung

Kannst du eine höfliche Antwort an Frau Sophie Lambert[NAME_1] formulieren?

Sie bittet um Erstattung ihrer Auslagen auf die IBAN FR76 3000 6000 0112 3456 7890 189[IBAN_1].

Ihre Sozialversicherungsnummer: 2 84 05 75 112 345 28[NIR_1], erreichbar unter 06 45 87 12 90[TELEFON_1].

4 Daten auf dem Gerät ersetzt
Die identifizierenden Daten werden durch einheitliche Platzhalter ersetzt; die Anfrage bleibt für den Assistenten verständlich. Fiktive Daten.

Vier Methoden und ihre Grenzen

Es gibt mehrere Wege, einen Text vor dem Senden vorzubereiten. Keiner ist perfekt, und die richtige Wahl hängt von Menge, Art der Daten und Risikoniveau ab.

1. Die manuelle Methode

Den Text durchlesen und jede Angabe von Hand durch einen neutralen Vermerk ersetzen. Das kostet nichts, und ein aufmerksamer Mensch erkennt identifizierenden Kontext gut, was ein automatisches Werkzeug schlecht kann. Die Grenzen sind bekannt: Es braucht Zeit, wird bei einer Datei mit mehreren hundert Zeilen unrealistisch und hängt ganz von der Wachsamkeit der Person ab, gerade dann, wenn sie unter Zeitdruck steht.

2. Online-Anonymisierungswerkzeuge

Manche Websites bieten an, einen Text einzufügen und eine „anonymisierte“ Fassung zu erhalten. Das Paradox liegt auf der Hand: Um Daten vor einem Onlinedienst zu schützen, vertraut man sie zuerst einem anderen Onlinedienst an, oft ohne Vertrag und ohne Angaben zur Speicherung. Bevor Sie ein solches Werkzeug nutzen, sollten Sie prüfen, wer es betreibt, wo die Daten verarbeitet werden und was mit ihnen geschieht, genau wie beim KI-Assistenten selbst.

3. Ein Werkzeug auf dem Gerät

Eine Browsererweiterung oder ein lokales Programm analysiert den Text auf dem Computer, bevor er hinausgeht. Der Hauptvorteil: Es greift genau im Moment des Kopierens und Einfügens oder des Anhängens einer Datei, ohne vom Gedächtnis jedes Einzelnen abzuhängen. Die Grenzen: Es erkennt strukturierte Daten gut (IBAN, Sozialversicherungsnummer, E-Mail-Adressen, Kartennummern, API-Schlüssel), freien Kontext dagegen viel schlechter; und es schützt nur die Werkzeuge, die es tatsächlich abdeckt.

4. Eine lokal installierte KI

Ein Sprachmodell auf dem eigenen Rechner laufen zu lassen, um sensible Daten zu erkennen oder ganz ohne Onlinedienst auszukommen, ist inzwischen möglich. Die Daten verlassen das Gerät nicht. Das Ergebnis eines Modells ist aber nicht deterministisch: Es kann eine Angabe je nach Einstellungen mal erkennen und mal übersehen, ohne dass sich immer erklären lässt, warum. Außerdem braucht es einen ausreichend leistungsfähigen Rechner, und die Installation solcher Werkzeuge verdient dieselbe Kontrolle wie jede andere Software.

KriteriumManuellOnline-WerkzeugLokales WerkzeugLokale KI
Die Daten bleiben auf dem GerätJaNeinJaJa
Greift beim Kopieren und EinfügenNeinNeinJaNein
Verarbeitet auch angehängte DateienTeilweiseTeilweiseJaTeilweise
Ergebnis erklärbar und reproduzierbarTeilweiseTeilweiseJaNein
Erkennt indirekte Angaben (Kontext)JaTeilweiseTeilweiseTeilweise
Hängt nicht von der Wachsamkeit jedes Einzelnen abNeinNeinJaNein
Orientierender Vergleich der vier Methoden durch die Redaktion. „Teilweise“ kennzeichnet ein Ergebnis, das vom Werkzeug oder von der Person abhängt.

In der Praxis lassen sich diese Methoden kombinieren. Die französische Behörde für Cybersicherheit ANSSI empfiehlt allgemein eine vorsichtige Haltung beim Einsatz generativer KI und besondere Aufmerksamkeit für die übermittelten Daten.8 Ein lokales Werkzeug für strukturierte Daten, eine menschliche Durchsicht für den Kontext und eine schriftliche Regel für Zweifelsfälle ergeben ein schlüssiges Ganzes.

Wie Tacite-IA vorgeht, auf dem Gerät

Tacite-IA gehört zur dritten Gruppe. Die Analyse läuft vollständig auf dem Computer, ohne KI: Präzise Regeln und Prüfberechnungen (Prüfziffer einer IBAN, einer Sozialversicherungsnummer, einer Bankkarte) erkennen die Daten, sodass jede Warnung erklärbar ist. Keine Nachricht und keine Datei wird zur Analyse an unsere Server gesendet.

  • Bei Nachrichten, in Chrome und Edge, mit ChatGPT, Claude, Copilot, Gemini und anderen Assistenten: Vor dem Senden zeigt ein Fenster die erkannten Daten und schlägt vor, die Fassung zu senden, in der sie durch Platzhalter ersetzt sind.
  • Bei Dateien (Word, Excel, PowerPoint, PDF oder Text), die in den Assistenten gezogen werden: Der Inhalt wird auf dem Gerät gelesen, und statt des Originals wird eine anonymisierte Textkopie gesendet. Gescannte PDFs oder PDFs mit kodierten Schriften sind nicht lesbar: Ihr Inhalt lässt sich nicht prüfen, was Tacite-IA meldet.
  • In Coding-Assistenten wie Claude Code oder Cursor: Die Nachrichten und die vom Assistenten gelesenen Dateien werden kontrolliert, und eine anonymisierte Kopie wird angeboten.
kundenexport.xlsxAnonymisierte Fassung

Kunde ; E-Mail ; IBAN ; offener Betrag

Herr Marc Petit[NAME_1] ; m.petit@exemple.fr[EMAIL_1] ; FR76 1027 8060 4100 0204 5590 174[IBAN_1] ; 3.200 €

Frau Inès Roche[NAME_2] ; i.roche@exemple.fr[EMAIL_2] ; FR76 3000 4000 3123 4567 8901 429[IBAN_2] ; 870 €

6 Daten auf dem Gerät ersetzt
Eine angehängte Datei, behandelt wie eine Nachricht: Die für die Berechnung nötigen Spalten bleiben, die Identitäten gehen als Platzhalter hinaus. Namen werden an der vorangestellten Anrede erkannt (Herr, Frau). Fiktive Daten.

Die Grenzen, offen gesagt: Wie jedes regelbasierte Werkzeug erkennt Tacite-IA strukturierte Daten und Vertraulichkeitsvermerke gut, versteht aber keinen frei formulierten identifizierenden Kontext. Namen werden nur dann automatisch erkannt, wenn ihnen eine Anrede oder ein Titel vorangeht (Herr, Frau, Dr.…): Ein Name allein, etwa in einer Tabellenspalte, wird nicht erkannt. Der mit Platzhaltern gesendete Text ist im Sinne der DSGVO in der Regel pseudonymisiert und nicht anonym. Und Desktop-Apps wie die ChatGPT-App für den Computer sind nicht abgedeckt: Tacite-IA meldet sie in der Konsole, ohne sie kontrollieren zu können.

Bewährte Praktiken im Überblick

  1. Fragen, ob die Angabe nötig istEine Umformulierung oder Übersetzung kommt gut ohne den echten Namen aus.
  2. Ersetzen, nicht nur löschenEinheitliche Platzhalter ([NAME_1], [IBAN_1]) halten den Text verständlich.
  3. An die Dateien denkenEin angehängter Export oder Vertrag enthält oft mehr als die Nachricht selbst.
  4. Den Kontext prüfenFunktion, Ort, Datum und Ereignis können genügen, um jemanden zu erkennen.
  5. Die Zuordnung auf dem Gerät behaltenDie Tabelle Platzhalter zu Wert geht nie mit dem Text hinaus.
  6. Die Regel aufschreibenEine Richtlinie, die festlegt, was zu entfernen ist und mit welchem Werkzeug.
Sechs einfache Reflexe, die sich in die Richtlinie zur KI-Nutzung übernehmen lassen.

Diese Reflexe gehören in eine schriftliche Regel: Unsere Vorlage für eine KI-Richtlinie enthält einen eigenen Artikel zu verbotenen Daten und zur Anonymisierung. Für Bereiche mit Berufsgeheimnis gehen die Anforderungen weiter: siehe unsere Leitfäden zur Steuer- und Buchhaltungskanzlei und zu Gesundheitsdaten.

Häufige Fragen

Genügt es, Namen durch Platzhalter zu ersetzen, um Daten zu anonymisieren?

In der Regel nicht. Wenn die Zuordnung zwischen Platzhaltern und echten Werten irgendwo existiert oder der Kontext die Person erkennbar macht, handelt es sich um eine Pseudonymisierung: Nach Erwägungsgrund 26 der DSGVO bleiben die Daten personenbezogen. Vor dem Senden an eine KI ist das dennoch eine gute Maßnahme der Datenminimierung.

Was ist der Unterschied zwischen Anonymisierung und Pseudonymisierung?

Die Pseudonymisierung verhindert, dass Daten ohne gesondert aufbewahrte zusätzliche Informationen einer Person zugeordnet werden können (Artikel 4 DSGVO): Die Daten unterliegen weiter der Verordnung. Die Anonymisierung macht jede Re-Identifizierung praktisch unmöglich, und zwar unumkehrbar: Die DSGVO gilt dann nicht mehr.

Welche Daten sollte man nie in ChatGPT eingeben?

Im Unternehmen sollten mindestens Namen und Kontaktdaten, Kennnummern wie die Sozialversicherungsnummer, Bankdaten, Gesundheitsdaten und andere sensible Daten nach Artikel 9 DSGVO sowie Passwörter und Zugangsschlüssel entfernt werden. Auch der Kontext (Funktion, Ort, Datum) kann genügen, um jemanden zu erkennen.

Sind Online-Anonymisierungswerkzeuge sicher?

Sie zwingen dazu, die Daten einem Drittanbieter anzuvertrauen, noch bevor sie an die KI gehen. Vor der Nutzung sollten Sie den Betreiber, den Ort der Verarbeitung und die Speicherung der Daten prüfen. Ein Werkzeug, das auf dem Gerät arbeitet, vermeidet diesen Schritt.

Ist eine lokale KI eine gute Lösung zum Anonymisieren?

Sie hält die Daten auf dem Computer, was ein echter Vorteil ist. Ihre Ergebnisse sind aber nicht deterministisch: Eine Angabe kann mal erkannt und mal ohne Erklärung übersehen werden. Außerdem braucht sie einen leistungsfähigen Rechner und eine Kontrolle der Installation.

Quellen

  1. Verordnung (EU) 2016/679 zum Schutz natürlicher Personen bei der Verarbeitung personenbezogener Daten (Datenschutz-Grundverordnung, DSGVO). EUR-Lex. Abgerufen am 5. Oktober 2026.
  2. L’anonymisation de données personnelles. CNIL (französische Datenschutzbehörde), 19. Mai 2020. Auf Französisch. Abgerufen am 8. Oktober 2026.
  3. Guidelines 01/2025 on Pseudonymisation (Fassung zur öffentlichen Konsultation). Europäischer Datenschutzausschuss (EDSA), angenommen am 16. Januar 2025. Auf Englisch. Abgerufen am 8. Oktober 2026.
  4. Stellungnahme 5/2014 zu Anonymisierungstechniken (WP216). Artikel-29-Datenschutzgruppe, 10. April 2014. Abgerufen am 8. Oktober 2026.
  5. Qui peut me demander mon numéro de sécurité sociale (NIR) ?. CNIL (französische Datenschutzbehörde). Auf Französisch. Abgerufen am 8. Oktober 2026.
  6. How OpenAI handles data in consumer services. OpenAI Help Center. Abgerufen am 5. Oktober 2026.
  7. Les questions-réponses de la CNIL sur l’utilisation d’un système d’IA générative. CNIL (französische Datenschutzbehörde), 18. Juli 2024. Auf Französisch. Abgerufen am 5. Oktober 2026.
  8. Recommandations de sécurité pour un système d’IA générative. ANSSI (französische Behörde für Cybersicherheit), 29. April 2024. Auf Französisch. Abgerufen am 5. Oktober 2026.
Eine Maßnahme unter mehreren

Die Nutzung steuern, ohne Ihre Teams auszubremsen

Tacite-IA erkennt sensible Daten in Nachrichten und Dateien, bevor sie in Chrome und Edge an KI-Assistenten gesendet werden, ebenso in Coding-Assistenten (Claude Code, Cursor, Windsurf, Codex, Gemini CLI, Copilot CLI). Die Analyse erfolgt zu 100 % auf dem Gerät, ohne KI, mit einer Administrationskonsole und einem Audit-Modus. Desktop-Apps (ChatGPT für den Computer, Chat-Tab von Claude Desktop, Copilot von Windows) werden nicht abgedeckt.

6 € zzgl. MwSt. pro Nutzer und Monat im Jahrestarif, 8 € zzgl. MwSt. im Monatstarif. 3 Monate Test.

Weitere Artikel