« J’ai enlevé le nom, c’est anonyme. » La phrase est rassurante, mais rarement exacte. Avant d’envoyer un courrier client, un tableau de paie ou un compte rendu à ChatGPT ou à un autre assistant, beaucoup de salariés retirent ce qui leur paraît sensible. C’est un bon réflexe. Encore faut-il savoir ce que le droit entend par « anonyme », quelles données masquer, et ce que chaque méthode protège vraiment. Ce guide fait le point, sources à l’appui, sans promettre plus que ce que les outils peuvent tenir.
Pourquoi anonymiser avant d’envoyer un texte à une IA
Un assistant IA en ligne traite le texte saisi et les fichiers joints sur les serveurs de son éditeur. Selon l’offre et les réglages, ces contenus sont conservés un temps et peuvent, pour les services grand public, servir à améliorer les modèles. Sur la page consacrée à ses services grand public, OpenAI demande d’ailleurs de ne pas saisir d’informations sensibles que l’on ne voudrait pas voir examinées ou utilisées.6 Nous détaillons ces règles, offre par offre, dans notre article sur ce que deviennent les données personnelles saisies dans ChatGPT.
Pour l’entreprise, l’enjeu est d’abord juridique. Le RGPD impose que les données personnelles soient « adéquates, pertinentes et limitées à ce qui est nécessaire » au regard de la finalité (principe de minimisation, article 5).1 Or la plupart des tâches confiées à une IA, comme reformuler, traduire, résumer ou structurer, n’ont pas besoin de savoir qui est la personne concernée. La CNIL recommande d’ailleurs d’encadrer l’usage de l’IA générative et de définir les données qui ne doivent pas y être saisies.7
Le message part tel quel : nom, IBAN et information de santé arrivent chez l’éditeur, qui les traite et les conserve selon les règles de l’offre utilisée.
Anonymisation ou pseudonymisation : ce que dit le RGPD
Les deux mots sont souvent employés l’un pour l’autre. Ils ne recouvrent pourtant pas la même chose, et la différence a des conséquences juridiques directes.
La pseudonymisation : des données qui restent personnelles
Le RGPD définit la pseudonymisation comme un traitement qui fait que les données ne peuvent plus être attribuées à une personne précise sans recourir à des informations supplémentaires, à condition que ces informations soient conservées séparément et protégées par des mesures techniques et organisationnelles (article 4, point 5).1 Remplacer « Claire Dupont » par « [NOM_1] » en gardant quelque part la table de correspondance relève typiquement de cette catégorie.
Le considérant 26 est explicite : des données pseudonymisées, qui pourraient être attribuées à une personne au moyen d’informations supplémentaires, restent des informations concernant une personne identifiable.1 Le RGPD continue donc de s’appliquer. Le Comité européen de la protection des données (CEPD) y a consacré des lignes directrices, adoptées le 16 janvier 2025 dans une version soumise à consultation publique, qui détaillent l’intérêt de la pseudonymisation comme mesure de protection.3 La CNIL le résume sans ambiguïté : des données pseudonymisées conservent un caractère personnel, et l’opération est réversible, contrairement à l’anonymisation.2
L’anonymisation : une transformation irréversible
À l’inverse, le même considérant 26 précise que le règlement ne s’applique pas aux informations anonymes, c’est-à-dire celles qui ne concernent pas une personne identifiée ou identifiable, ou rendues anonymes de telle manière que la personne ne soit plus identifiable.1 Pour en juger, il faut tenir compte de l’ensemble des moyens raisonnablement susceptibles d’être utilisés pour identifier la personne, compte tenu notamment du coût, du temps nécessaire et de la technologie disponible.1
Pour la CNIL, l’anonymisation doit rendre impossible, en pratique, toute identification de la personne par quelque moyen que ce soit, et de manière irréversible.2 Les autorités européennes de protection des données, dans leur avis du 10 avril 2014 sur les techniques d’anonymisation, proposent trois critères pour l’évaluer : l’individualisation (peut-on encore isoler une personne ?), la corrélation (peut-on relier des données qui la concernent ?) et l’inférence (peut-on déduire une information à son sujet ?).4
Ce qu’il faut masquer avant ChatGPT
La liste dépend du métier, mais certaines catégories reviennent partout.
- L’identité et les coordonnées : noms et prénoms, adresses postales, adresses e-mail, numéros de téléphone, identifiants de compte client.
- Les identifiants nationaux, à commencer par le numéro de sécurité sociale (NIR) : la CNIL rappelle qu’il ne peut être utilisé que dans des cas bien précis, le plus souvent en lien avec la protection sociale.5 Il en va de même pour les numéros de passeport ou de carte d’identité.
- Les données bancaires : IBAN, numéros de carte, références de prélèvement.
- Les catégories particulières de données de l’article 9 du RGPD : santé, opinions politiques, convictions religieuses, appartenance syndicale, orientation sexuelle, origine.1 Un arrêt maladie mentionné dans un e-mail RH en fait partie.
- Les secrets techniques : mots de passe, clés API, jetons d’accès, chaînes de connexion. Ce ne sont pas des données personnelles, mais leur fuite peut ouvrir l’accès à des systèmes entiers. Les développeurs y sont particulièrement exposés avec les assistants de code (voir notre guide pour protéger ses secrets dans Claude Code et Cursor).
- Le contexte. C’est le piège le plus fréquent. « La directrice financière de notre filiale de Lyon, en arrêt depuis mars » identifie une personne sans citer son nom. La fonction, la ville, une date et un événement suffisent souvent.
Peux-tu rédiger une réponse courtoise à Mme Sophie Lambert[NOM_1] ?
Elle demande le remboursement de ses frais sur l’IBAN FR76 3000 6000 0112 3456 7890 189[IBAN_1].
Son n° de sécurité sociale : 2 84 05 75 112 345 28[NIR_1], joignable au 06 45 87 12 90[TEL_1].
Quatre méthodes et leurs limites
Il existe plusieurs façons de préparer un texte avant de l’envoyer. Aucune n’est parfaite, et le bon choix dépend du volume, du type de données et du niveau de risque.
1. La méthode manuelle
Relire le texte et remplacer à la main chaque donnée par une mention neutre. Elle ne coûte rien et un humain attentif repère bien le contexte identifiant, ce qu’un outil automatique fait mal. Ses limites sont connues : elle prend du temps, devient irréaliste sur un fichier de plusieurs centaines de lignes, et repose entièrement sur la vigilance de la personne au moment où elle est pressée.
2. Les outils d’anonymisation en ligne
Des sites proposent de coller un texte pour en obtenir une version « anonymisée ». Le paradoxe est évident : pour protéger des données d’un service en ligne, on les confie d’abord à un autre service en ligne, souvent sans contrat ni information sur la conservation. Avant d’en utiliser un, il faut vérifier qui l’édite, où les données sont traitées et ce qu’elles deviennent, exactement comme pour l’assistant IA lui-même.
3. Un outil installé sur le poste
Une extension de navigateur ou un programme local analyse le texte sur l’ordinateur, avant qu’il ne parte. Son avantage principal : il intervient au moment précis du copier-coller ou de l’ajout d’un fichier, sans dépendre de la mémoire de chacun. Ses limites : il repère bien les données structurées (IBAN, NIR, e-mails, numéros de carte, clés API), mais beaucoup moins le contexte libre ; et il ne protège que les outils qu’il couvre réellement.
4. Une IA installée localement
Faire tourner un modèle de langage sur sa propre machine pour repérer les données sensibles, ou pour se passer entièrement d’un service en ligne, est devenu possible. Les données ne quittent pas le poste. Mais le résultat d’un modèle n’est pas déterministe : il peut oublier une donnée d’une fois sur l’autre, selon les réglages, sans qu’on puisse toujours expliquer pourquoi. Il faut aussi une machine suffisamment puissante, et l’installation de ces outils mérite le même contrôle que n’importe quel logiciel.
| Critère | Manuelle | Outil en ligne | Outil local | IA locale |
|---|---|---|---|---|
| Les données restent sur le poste | Oui | Non | Oui | Oui |
| Fonctionne au moment du copier-coller | Non | Non | Oui | Non |
| Traite aussi les fichiers joints | En partie | En partie | Oui | En partie |
| Résultat explicable et reproductible | En partie | En partie | Oui | Non |
| Repère les données indirectes (contexte) | Oui | En partie | En partie | En partie |
| Ne dépend pas de la vigilance de chacun | Non | Non | Oui | Non |
En pratique, ces méthodes se combinent. L’ANSSI recommande, de façon générale, une posture de prudence lors du déploiement de l’IA générative et une attention particulière aux données transmises.8 Un outil local pour les données structurées, une relecture humaine pour le contexte et une règle écrite pour trancher les cas douteux forment un ensemble cohérent.
Comment Tacite-IA s’y prend, sur le poste
Tacite-IA appartient à la troisième famille. L’analyse se fait entièrement sur l’ordinateur, sans IA : des règles précises et des calculs de contrôle (clé d’un IBAN, d’un numéro de sécurité sociale, d’une carte bancaire) repèrent les données, ce qui rend chaque alerte explicable. Aucun message ni fichier n’est envoyé à nos serveurs pour analyse.
- Pour les messages, dans Chrome et Edge, face à ChatGPT, Claude, Copilot, Gemini et d’autres assistants : avant l’envoi, une fenêtre montre les données repérées et propose d’envoyer la version où elles sont remplacées par des balises.
- Pour les fichiers Word, Excel, PowerPoint, PDF ou texte glissés dans l’assistant : le contenu est lu sur le poste, et une copie texte anonymisée est envoyée à la place de l’original. Les PDF scannés ou à polices encodées ne sont pas lisibles : leur contenu ne peut pas être vérifié, ce que Tacite-IA signale.
- Dans les assistants de code comme Claude Code ou Cursor : les messages et les fichiers lus par l’assistant sont contrôlés, et une copie anonymisée est proposée.
client ; e-mail ; IBAN ; encours
M. Marc Petit[NOM_1] ; m.petit@exemple.fr[EMAIL_1] ; FR76 1027 8060 4100 0204 5590 174[IBAN_1] ; 3 200 €
Mme Inès Roche[NOM_2] ; i.roche@exemple.fr[EMAIL_2] ; FR76 3000 4000 3123 4567 8901 429[IBAN_2] ; 870 €
Les limites, dites franchement : comme tout outil à base de règles, Tacite-IA repère bien les données structurées et les marquages de confidentialité, mais ne comprend pas un contexte identifiant formulé librement. Les noms ne sont repérés automatiquement que lorsqu’ils sont précédés d’une civilité (M., Mme, Dr…) : un nom seul, par exemple dans une colonne de tableur, ne l’est pas. Le texte envoyé avec des balises reste, au sens du RGPD, généralement pseudonymisé et non anonyme. Et les applications de bureau, comme ChatGPT pour ordinateur, ne sont pas couvertes : Tacite-IA les signale dans la console sans pouvoir les contrôler.
Les bonnes pratiques à retenir
- Se demander si la donnée est utileUne reformulation ou une traduction se passe très bien du vrai nom.
- Remplacer, ne pas seulement effacerDes balises cohérentes ([NOM_1], [IBAN_1]) gardent le texte compréhensible.
- Penser aux fichiersUn export ou un contrat joint contient souvent plus que le message lui-même.
- Relire le contexteFonction, ville, date et événement peuvent suffire à identifier quelqu’un.
- Garder la correspondance sur le posteLa table balise vers valeur ne part jamais avec le texte.
- Écrire la règleUne charte qui dit quoi masquer et avec quel outil.
Ces réflexes ont leur place dans une règle écrite : notre modèle de charte IA prévoit un article dédié aux données interdites et à l’anonymisation. Pour les secteurs soumis à un secret professionnel, les exigences vont plus loin : voir nos guides consacrés à l’expertise comptable et aux données de santé.
Questions fréquentes
Remplacer les noms par des balises suffit-il à anonymiser des données ?
En général, non. Si la correspondance entre les balises et les vraies valeurs existe quelque part, ou si le contexte permet de retrouver la personne, il s’agit d’une pseudonymisation : selon le considérant 26 du RGPD, les données restent personnelles. C’est néanmoins une bonne mesure de minimisation avant l’envoi à une IA.
Quelle est la différence entre anonymisation et pseudonymisation ?
La pseudonymisation empêche d’attribuer les données à une personne sans informations supplémentaires conservées à part (article 4 du RGPD) : les données restent soumises au règlement. L’anonymisation rend toute réidentification impossible en pratique, de manière irréversible : le RGPD ne s’applique plus.
Quelles données ne faut-il jamais saisir dans ChatGPT ?
En entreprise, il faut au minimum retirer les noms et coordonnées, les identifiants comme le numéro de sécurité sociale, les données bancaires, les données de santé et autres données sensibles de l’article 9 du RGPD, ainsi que les mots de passe et clés d’accès. Le contexte (fonction, lieu, date) peut aussi suffire à identifier quelqu’un.
Les outils d’anonymisation en ligne sont-ils sûrs ?
Ils obligent à confier les données à un service tiers avant même l’envoi à l’IA. Avant d’en utiliser un, il faut vérifier son éditeur, le lieu de traitement et la conservation des données. Un outil qui travaille sur le poste évite cette étape.
Une IA locale est-elle une bonne solution pour anonymiser ?
Elle garde les données sur l’ordinateur, ce qui est un avantage réel. Mais ses résultats ne sont pas déterministes : une donnée peut être oubliée d’une fois sur l’autre sans explication. Elle demande aussi une machine puissante et un contrôle de l’installation.
Sources
- Règlement (UE) 2016/679 relatif à la protection des données (RGPD). EUR-Lex. Consulté le 5 octobre 2026.
- L’anonymisation de données personnelles. CNIL, 19 mai 2020. Consulté le 8 octobre 2026.
- Guidelines 01/2025 on Pseudonymisation (version soumise à consultation publique). Comité européen de la protection des données (CEPD), adoptées le 16 janvier 2025. En anglais. Consulté le 8 octobre 2026.
- Avis 05/2014 sur les techniques d’anonymisation (WP216). Groupe de travail « article 29 » sur la protection des données, 10 avril 2014. Consulté le 8 octobre 2026.
- Qui peut me demander mon numéro de sécurité sociale (NIR) ?. CNIL. Consulté le 8 octobre 2026.
- How OpenAI handles data in consumer services. OpenAI Help Center. Consulté le 5 octobre 2026.
- Les questions-réponses de la CNIL sur l’utilisation d’un système d’IA générative. CNIL, 18 juillet 2024. Consulté le 5 octobre 2026.
- Recommandations de sécurité pour un système d’IA générative. ANSSI, 29 avril 2024. Consulté le 5 octobre 2026.
ChatGPT est une marque d’OpenAI, Copilot de Microsoft, Claude d’Anthropic, Gemini de Google, Cursor d’Anysphere. Les autres noms de produits cités appartiennent à leurs propriétaires respectifs. Tacite-IA n’est affilié à aucun de ces éditeurs. Article informatif, qui ne constitue pas un conseil juridique.