Données personnelles et IA : que retirer avant d'utiliser un assistant
Données personnelles et IA se concilient dès lors que le document est préparé avant de quitter le poste. Un contrat, un compte rendu, un dossier de sinistre ou un bulletin de paie déposé dans un assistant en ligne devient une donnée traitée par un tiers. Le RGPD s'applique à cet envoi comme à n'importe quel autre.
Les assistants rendent de vrais services ; nous proposons ici de savoir ce qui est une donnée personnelle, ce que la CNIL et le Comité européen de la protection des données en disent, et comment retirer ces informations d'un document avant de l'envoyer, avec Biffer ou autrement. Avec un objectif concret : réduire à la source ce qui sort, la mesure la plus directement à votre portée.
Qu'est-ce qu'une donnée personnelle dans un document ?
À retenir
- Une donnée personnelle est toute information se rapportant à une personne identifiée ou identifiable, directement ou par recoupement (RGPD, article 4).
- Envoyer un document à un assistant d'IA est un traitement : il doit avoir une base légale, une finalité et des garanties.
- La CNIL et l'EDPB admettent l'usage des modèles d'IA, à condition de limiter les données transmises et de documenter les choix.
- Pseudonymiser ou masquer les données avant l'envoi, sur votre poste, réduit ce qui sort sans empêcher l'assistant de travailler.
Le RGPD (règlement UE 2016/679) définit à son article 4 la donnée personnelle comme toute information se rapportant à une personne physique identifiée ou identifiable. Le point important est « identifiable » : la notion va bien au-delà du nom. Une adresse, une date de naissance, un numéro de dossier, une immatriculation, une fonction dans une petite structure, ou la combinaison de plusieurs de ces éléments, suffisent. Le texte est accessible sur le site de la CNIL (article 4 du RGPD). L'expression anglaise PII (Personally Identifiable Information) recouvre à peu près la même idée, la notion européenne étant plus large.
Dans un document professionnel, on rencontre principalement :
- Les données nominatives : nom, prénom, civilité, signature, nom d'un proche cité dans le texte.
- Les coordonnées : adresse postale, email, téléphone.
- Les identifiants : numéro de sécurité sociale, IBAN, SIREN ou SIRET d'un entrepreneur individuel, plaque d'immatriculation, numéro de dossier, de police, de sinistre, de contrat, matricule, toque, RPPS, CRPCEN.
- Les données sensibles au sens de l'article 9 : santé, origine, opinions, appartenance syndicale, orientation sexuelle, données biométriques, dont le traitement est en principe interdit sauf exception.
- Les informations confidentielles non personnelles : montants, clauses, secrets d'affaires, qui relèvent du secret professionnel ou contractuel plutôt que du RGPD.
RGPD et ChatGPT : ce qui se passe quand on dépose un fichier
Quand vous déposez un document dans ChatGPT, Claude, Gemini ou un autre assistant en ligne, trois choses se produisent du point de vue du règlement. D'abord, un transfert : le fichier est envoyé sur les serveurs de l'éditeur, qui peuvent se trouver hors de l'Union européenne, ce qui engage les règles du chapitre V du RGPD. Ensuite, un traitement par un tiers : l'éditeur devient sous-traitant, ou responsable conjoint selon les conditions d'utilisation, et vous devez disposer d'un cadre contractuel adapté (article 28). Enfin, selon l'offre et les réglages, une conservation et parfois une réutilisation des contenus pour améliorer le service.
Ces trois points rendent l'usage possible, à des conditions précises. Vous devez pouvoir répondre aux questions suivantes :
- Quelle est la finalité de l'envoi (résumer, traduire, rédiger, analyser) et quelle est sa base légale ?
- Les personnes concernées ont-elles été informées que leurs données pouvaient être traitées par un prestataire d'IA ?
- Le prestataire offre-t-il les garanties contractuelles exigées, et où ses serveurs sont-ils situés ?
- Le document envoyé contient-il plus de données personnelles que nécessaire à la finalité ?
La dernière question est celle qui dépend le plus de vous, et c'est celle qu'un outil comme Biffer aide à traiter. Pour résumer un contrat ou reformuler un compte rendu, un alias (PERSONNE_001) donne à l'assistant tout ce dont il a besoin pour une réponse cohérente ; le nom de Marie Dupont et son adresse restent sur votre poste. C'est la minimisation des données (article 5 du règlement) appliquée concrètement. Nous décrivons cet usage sur les pages anonymiser avant ChatGPT, anonymiser avant Claude et anonymiser avant Gemini.
Ce que disent la CNIL et l'EDPB
Les autorités de protection des données ont publié, depuis 2023, un ensemble de repères sur l'IA générative.
La CNIL a mis en ligne un dossier consacré à l'intelligence artificielle, avec des recommandations pour le développement de systèmes d'IA et des fiches pratiques, notamment sur la constitution de bases de données d'entraînement et l'information des personnes (dossier intelligence artificielle de la CNIL). Elle y rappelle que les principes du RGPD s'appliquent à toutes les phases, de la collecte des données d'entraînement à l'usage du modèle, et que la pseudonymisation et l'anonymisation des jeux de données figurent parmi les mesures attendues. Son guide sur l'anonymisation de données personnelles précise les critères d'une anonymisation effective.
Le Comité européen de la protection des données (EDPB) a adopté le 17 décembre 2024 son avis 28/2024 sur certains aspects de la protection des données dans le contexte des modèles d'IA. Il y traite de trois questions : quand un modèle d'IA entraîné sur des données personnelles peut-il être considéré comme anonyme, comment l'intérêt légitime peut servir de base légale au développement et au déploiement, et quelles conséquences a un entraînement illicite sur l'usage ultérieur du modèle. Le comité y indique que l'anonymat d'un modèle s'apprécie au cas par cas, et que des données d'entraînement anonymisées ou pseudonymisées font partie des mesures qui pèsent dans cette appréciation.
Pour un utilisateur de documents, la conséquence pratique est double : choisir un prestataire d'IA dont les conditions sont compatibles avec la protection des données, et réduire à la source les données personnelles envoyées, mesure la plus directement à votre portée.
Retirer les données personnelles avant l'envoi : la méthode
Biffer est un logiciel de bureau, pour Mac et pour PC (Windows), conçu par Romain Rissoan, formateur et consultant à Lyon. Il fonctionne hors ligne : le document est analysé, relu et réécrit sur votre ordinateur, et vos fichiers comme chaque fragment de texte restent sur votre poste. Ce choix est expliqué sur la page logiciel hors ligne.
1. Identifier
Le logiciel surligne les personnes, emails, téléphones, adresses, SIREN et SIRET, numéros de sécurité sociale, IBAN, plaques, dates et champs métier. Vous décochez les faux positifs et ajoutez ce qui manque, pour toutes les occurrences d'un coup.
2. Décider
Par type de donnée : pseudonymiser (alias stable comme PERSONNE_001), masquer ([PERSONNE]) ou conserver. Créer ou non une table de correspondance, chiffrée (Argon2id et AES-256-GCM) ou en clair.
3. Réécrire
Le texte est remplacé en place dans le PDF, le fichier Word, Excel, CSV ou texte ; la mise en forme est conservée et les métadonnées (auteur, société, auteurs des commentaires) sont vidées.
4. Envoyer, puis restaurer
Le document pseudonymisé est soumis à l'assistant. Si vous avez conservé la table, les valeurs d'origine sont restaurées dans la réponse, sur votre poste.
Ce que cette méthode garantit : les données que vous avez retirées restent sur votre poste, et le fichier envoyé en est vidé. Ce qui reste entre vos mains : la relecture contre les recoupements, le choix d'un prestataire offrant des garanties, et l'information des personnes. La distinction entre pseudonymisation et anonymisation, et ce qu'elle implique au regard du RGPD, est développée sur la page anonymiser un document.
Questions fréquentes
Peut-on utiliser ChatGPT avec des données personnelles en restant conforme au RGPD ?
Oui, à condition de traiter cet usage comme n'importe quel traitement : une finalité définie, une base légale, l'information des personnes, un prestataire offrant des garanties contractuelles suffisantes, et la minimisation des données envoyées. En pratique, le levier le plus simple est d'envoyer uniquement le nécessaire : un résumé ou une reformulation se fait très bien avec des alias à la place des noms, adresses, numéros de sécurité sociale ou IBAN. Pseudonymiser le document avant l'envoi, puis restaurer les valeurs dans la réponse, permet de travailler avec l'assistant tout en réduisant fortement la part identifiante de ce qui quitte votre poste.
Quelle différence entre données personnelles, données sensibles et informations confidentielles ?
Les données personnelles sont toutes les informations se rapportant à une personne physique identifiable : nom, coordonnées, identifiants, mais aussi éléments indirects comme une date associée à un lieu. Les données sensibles en sont une sous-catégorie, définie à l'article 9 du RGPD : santé, origine, opinions politiques ou religieuses, appartenance syndicale, vie sexuelle, données génétiques et biométriques. Leur traitement est en principe interdit, sauf exceptions limitatives. Les informations confidentielles, elles, peuvent concerner autre chose qu'une personne : montants, clauses, procédés, secrets d'affaires. Elles relèvent du secret professionnel ou du contrat plutôt que du RGPD.
Des données d'entraînement anonymisées suffisent-elles à rendre un modèle d'IA anonyme ?
C'est l'une des mesures qui comptent, parmi d'autres. L'avis 28/2024 de l'EDPB indique que l'anonymat d'un modèle s'apprécie au cas par cas, en vérifiant que le modèle résiste, avec des moyens raisonnables, à l'extraction de données personnelles et aux requêtes qui viseraient à les obtenir. L'anonymisation ou la pseudonymisation des données d'entraînement est l'une des mesures prises en compte, avec la méthode d'entraînement, les filtres de sortie et la documentation. Pour la plupart des professionnels, la question est plus modeste : il s'agit d'utiliser un assistant plutôt que d'entraîner un modèle. Réduire les données personnelles dans les documents soumis reste alors la mesure la plus efficace et la plus facile à démontrer.
Biffer garantit-il la conformité RGPD de mon usage de l'IA ?
Biffer y contribue directement, et vous gardez la maîtrise de l'ensemble. Il retire du document, sur votre ordinateur, les données personnelles qu'il détecte et que vous validez, en conservant la lisibilité grâce à des alias cohérents. C'est une mesure de pseudonymisation, encouragée par les articles 25 et 32 du RGPD, et une application concrète de la minimisation. Elle s'ajoute à l'analyse de la base légale, à l'information des personnes, au choix d'un prestataire d'IA présentant des garanties et à la relecture du document produit, qui restent entre vos mains : vous êtes responsable de traitement, et Biffer vous en donne les moyens.
Vos documents professionnels anonymisés, prêts à être diffusés publiquement ou à un outil d'IA.
Biffer tourne sur votre ordinateur sans envoyer le moindre fichier. Gratuit pour cinq fichiers par mois, illimité pour 10 € HT par poste.
100 % hors ligne · Gratuit : 5 fichiers par mois · Aucun fichier envoyé