Qu'est-ce que l'anonymisation ? Définition, méthodes et exemples
L'anonymisation est un traitement qui transforme des données personnelles de façon irréversible, afin qu'il ne soit plus possible, en pratique, d'identifier la personne concernée, directement ou par recoupement. Anonymiser, c'est donc rendre anonyme : un document ou un fichier anonymisé ne permet plus de savoir de qui il parle, même en le croisant avec d'autres informations disponibles.
Le mot recouvre deux réalités proches. Dans le langage courant, anonymiser signifie retirer le nom : un témoignage anonymisé, une copie d'examen anonymisée. Au sens du RGPD et de la CNIL, l'exigence est plus forte, car le nom n'est qu'un identifiant parmi d'autres. Une date de naissance, une adresse, une fonction rare ou un numéro de dossier suffisent souvent à reconnaître quelqu'un. L'anonymisation au sens juridique vise l'ensemble de ces éléments.
On rencontre aussi le verbe anonymer. Les deux formes existent : anonymiser est celle de l'usage courant, de la CNIL et des textes européens à travers le nom anonymisation ; anonymer, plus rare, se rencontre dans certains usages administratifs, avec le même sens. Au Québec et dans le domaine de la santé, on parle parfois de désidentification ou de dépersonnalisation, des notions qui correspondent plutôt au retrait des identifiants directs.
Cet article donne la définition de référence, présente les méthodes reconnues et illustre la notion par des exemples. La méthode pas à pas pour un fichier figure dans l'article comment anonymiser un document, et la frontière avec la pseudonymisation dans l'article anonymisation ou pseudonymisation.
La définition de l'anonymisation selon le RGPD et la CNIL
Le RGPD ne définit pas l'anonymisation dans son article 4, mais il en fixe les effets dans son considérant 26 : les principes de protection des données ne s'appliquent pas aux informations anonymes, c'est-à-dire ne concernant pas une personne identifiée ou identifiable, ni aux données rendues anonymes de telle manière que la personne n'est plus identifiable. Pour en juger, le texte demande de tenir compte de l'ensemble des moyens raisonnablement susceptibles d'être utilisés, au regard du coût, du temps nécessaire et de l'état de la technique.
La CNIL, dans sa fiche sur l'anonymisation des données personnelles, la décrit comme un ensemble de techniques visant à rendre impossible, en pratique, toute identification de la personne, par quelque moyen que ce soit et de manière irréversible. Trois critères permettent de vérifier le résultat :
- l'individualisation : on ne peut plus isoler une personne dans le jeu de données ;
- la corrélation : on ne peut plus relier ces données à d'autres données concernant la même personne ;
- l'inférence : on ne peut plus déduire avec quasi-certitude une information nouvelle sur une personne.
Deux conséquences en découlent. D'abord, l'anonymisation s'apprécie au cas par cas, selon les informations dont dispose le destinataire : un document anonyme pour un lecteur extérieur peut rester identifiant pour un collègue de la personne. Ensuite, elle est une opération irréversible : si une table permet de retrouver les noms, les données sont pseudonymisées et restent des données personnelles. Les textes applicables sont rassemblés sur la page réglementation.
Les méthodes d'anonymisation : randomisation et généralisation
L'avis 05/2014 du G29, le groupe des autorités européennes devenu le Comité européen de la protection des données, classe les techniques d'anonymisation en deux grandes familles, souvent combinées. La CNIL reprend cette classification.
| Famille | Principe | Exemples de techniques |
|---|---|---|
| Randomisation | Modifier les valeurs pour rompre le lien avec la personne, en conservant la répartition d'ensemble | Ajout de bruit, permutation de valeurs entre lignes, confidentialité différentielle |
| Généralisation | Élargir l'échelle d'un attribut pour qu'il soit commun à plusieurs personnes | Date de naissance ramenée à l'année, commune ramenée au département, salaire ramené à une tranche, k-anonymat |
Ces techniques ont été pensées pour des bases de données. Pour un document (contrat, compte rendu, courrier, rapport), la démarche s'adapte en quatre gestes :
- supprimer les identifiants directs : nom, adresse, email, téléphone, numéro de sécurité sociale, IBAN ;
- masquer par une étiquette neutre, comme [PERSONNE] ou [ADRESSE], quand la mention doit rester visible ;
- généraliser les identifiants indirects : âge plutôt que date de naissance, région plutôt qu'adresse, « un cadre du service » plutôt que l'intitulé exact du poste ;
- vérifier les contenus cachés (métadonnées, commentaires, historique) et relire le résultat avec les trois critères.
Le remplacement d'un nom par un alias stable, comme PERSONNE_001, n'est pas en lui-même une anonymisation : c'est une pseudonymisation, utile et légitime, mais réversible tant que la correspondance existe quelque part. Elle ne devient une étape vers l'anonymisation que si la table est détruite, ou jamais créée, et si les identifiants indirects ont aussi été traités.
Exemples d'anonymisation réussie et d'anonymisation manquée
- Un modèle de contrat de travail. Le service RH retire le nom, l'adresse et le numéro de sécurité sociale du salarié, remplace la rémunération par une tranche et l'intitulé du poste par une fonction générique. Le modèle peut circuler sans désigner personne.
- Un cas clinique pour l'enseignement. Le compte rendu perd l'identité du patient, mais aussi la commune, la date d'admission et la profession, qui suffiraient à le reconnaître dans un petit établissement.
- Les décisions de justice en accès libre. Les noms des personnes physiques parties ou tiers sont occultés avant diffusion, et les autres éléments identifiants peuvent l'être aussi lorsque leur divulgation porterait atteinte à la sécurité ou à la vie privée des personnes.
À l'inverse, un exemple célèbre montre les limites d'une anonymisation superficielle. En 2006, AOL a publié des millions de requêtes de recherche où chaque utilisateur était remplacé par un simple numéro. Des journalistes du New York Times ont pourtant retrouvé l'identité de l'une des personnes à partir du contenu de ses recherches : noms de lieux, de commerces, de proches. Le numéro était un pseudonyme ; le contenu restait identifiant.
Biffer aide à appliquer ces principes sur votre ordinateur, hors ligne. Le logiciel détecte les identifiants directs et les champs propres à 18 métiers, vous laisse choisir pour chaque type de donnée entre pseudonymiser, masquer ou conserver, et vide les métadonnées. Sans table de correspondance, et après traitement des identifiants indirects, le document se rapproche de l'anonymisation ; la relecture finale vous revient. La page anonymiser un document détaille ces réglages.
Anonymisez vos documents sans les faire sortir de votre ordinateur
Biffer, édité par Opcadia et conçu par Romain Rissoan, formateur et consultant, s'installe sur Mac et PC et fonctionne entièrement hors ligne. Essayez-le gratuitement sur cinq fichiers par mois, puis passez à l'illimité pour 10 € HT, payés une seule fois.
Questions fréquentes
Que signifie « anonymisé » en français ?
Anonymisé signifie rendu anonyme : une donnée ou un document anonymisé ne permet plus d'identifier la personne dont il parle. Au sens du RGPD, cela suppose que l'identification soit impossible par tous les moyens raisonnables, y compris par recoupement avec d'autres sources.
Faut-il dire anonymer ou anonymiser ?
Les deux verbes existent et ont le même sens. Anonymiser est de loin le plus employé, notamment par la CNIL et dans les textes sur la protection des données. Anonymer, plus rare, reste en usage dans certains textes administratifs. Pour un document professionnel, anonymiser est la forme à privilégier.
Des données anonymisées sont-elles encore soumises au RGPD ?
Non, si elles sont réellement anonymes : le considérant 26 du RGPD les exclut du champ du règlement. En revanche, l'opération d'anonymisation elle-même porte sur des données personnelles et doit respecter le RGPD, et des données seulement pseudonymisées y restent soumises.
Vos documents professionnels anonymisés, prêts à être diffusés publiquement ou à un outil d'IA.
Biffer tourne sur votre ordinateur sans envoyer le moindre fichier. Gratuit pour cinq fichiers par mois, illimité pour 10 € HT par poste.
100 % hors ligne · Gratuit : 5 fichiers par mois · Aucun fichier envoyé