Sécurité de l’IA : quelles données ne faut-il jamais partager ?
Contrôler rigoureusement les données saisies est indispensable lorsque l’on utilise des modèles de langage grand public : les informations transmises à ces outils d’intelligence artificielle quittent l’environnement local de l’utilisateur. Saisir des données confidentielles dans une IA expose à des fuites, à la divulgation de secrets commerciaux et à des infractions aux règles de protection des données personnelles. Il faut donc aborder chaque interaction avec une IA comme si son contenu pouvait devenir public.
Quelles données ne faut-il pas saisir dans une IA ?
Il ne faut jamais soumettre les catégories de données suivantes à des modèles accessibles au public :
- données personnelles – noms, prénoms, adresses, numéros de sécurité sociale, numéros de téléphone ou adresses e-mail, qu’il s’agisse des vôtres ou de ceux de clients et de salariés ;
- dossiers médicaux – antécédents, résultats d’examens et diagnostics de patients, soumis à des règles juridiques strictes, notamment le RGPD ou la loi HIPAA ;
- informations confidentielles de l’entreprise – rapports financiers non publiés, stratégies marketing, fichiers clients ou projets de fusion, d’acquisition ou de licenciement ;
- secrets commerciaux – code source, formules de fabrication, algorithmes exclusifs ou documentation technique interne ;
- identifiants et moyens d’accès – mots de passe, clés API, identifiants de connexion, jetons d’authentification, données de cartes bancaires et clés de chiffrement ;
- œuvres protégées par le droit d’auteur – textes intégraux de livres, articles scientifiques payants ou scénarios pour lesquels vous ne disposez pas des droits nécessaires ;
- contenus illégaux – contenus faisant l’apologie de la violence ou de la haine, ou instructions visant à commettre des actes contraires à la loi.
Que deviennent les données saisies dans une IA ?
Les données envoyées aux fournisseurs de services cloud passent par plusieurs étapes de traitement et d’analyse. Leur utilisation ne se limite pas à la génération d’une réponse.
Entraînement des modèles
Les données saisies dans les versions grand public standard des outils d’IA générative peuvent servir à poursuivre l’entraînement des modèles. Ces informations peuvent alors influencer les paramètres du réseau neuronal et, en théorie, réapparaître ultérieurement dans une réponse destinée à un autre utilisateur.
Examen humain et modération
En plus du traitement automatisé, les systèmes d’IA disposent de filtres de sécurité. Si un algorithme juge une requête suspecte, par exemple parce qu’elle semble enfreindre les conditions d’utilisation, la conversation peut être signalée puis soumise à un examen humain. Des employés du fournisseur ou des prestataires chargés de l’annotation des données peuvent ainsi accéder directement au contenu saisi afin d’améliorer les mécanismes de modération.
Conservation des données et sauvegardes
Les fournisseurs d’IA conservent les conversations sur leurs serveurs pour assurer la continuité du service, diagnostiquer les erreurs et préserver le contexte des sessions futures. Supprimer une conversation dans l’interface ne signifie généralement pas que ses données disparaissent immédiatement des serveurs. Elles peuvent rester un certain temps dans les sauvegardes du fournisseur, ce qui accroît le risque d’exposition d’informations confidentielles en cas de cyberattaque réussie contre son infrastructure cloud.
Comptes personnels et comptes professionnels : quelles différences de protection ?
Le niveau de sécurité des outils d’IA varie considérablement selon le type d’abonnement et le mode de déploiement.
Les comptes personnels standard, gratuits ou payants, de nombreux services populaires peuvent utiliser par défaut les informations transmises pour entraîner leurs modèles. Dès lors, partager des ressources confidentielles au cours d’une session risque d’en entraîner une divulgation incontrôlée.
Dans les environnements professionnels et d’entreprise — par exemple les offres Enterprise ou les services déployés dans des clouds privés au moyen des API de fournisseurs comme Microsoft Azure, AWS ou Google Cloud — les exigences de protection sont plus strictes. Les fournisseurs garantissent le respect de normes de sécurité telles qu’ISO 27001 et SOC 2, ainsi que du RGPD, et indiquent dans leurs contrats (SLA/DPA) que les données des clients ne servent pas à entraîner les modèles publics de base. Les restrictions concernant les données saisies peuvent y être moins sévères, mais une politique de gestion des risques et des contrôles d’accès restent nécessaires.
Quelles informations peut-on saisir sans risque dans une IA ?
Malgré ces précautions, de nombreuses informations peuvent être soumises à une IA sans risque particulier. C’est notamment le cas des éléments suivants :
- contenus accessibles au public – articles en libre accès, billets de blog, études de marché publiques, textes de loi ou contenus provenant de sites web comme Wikipédia ;
- informations non confidentielles – consignes générales, questions sur des notions théoriques, règles de grammaire et d’orthographe, équations mathématiques ou demandes de définition ;
- extraits de documents anonymisés – modèles de courriers, modèles de contrats ou extraits de code dont ont été retirés tous les identifiants particuliers, clés, noms de clients et détails d’architecture interne ;
- textes que vous avez rédigés – brouillons d’e-mails, publications pour les réseaux sociaux, plans de présentation ou articles ne contenant aucune donnée professionnelle sensible ;
- jeux de données ouverts – données synthétiques ou statistiques issues de dépôts publics, utilisées pour s’exercer à l’analyse et à la mise en forme.
Comment anonymiser efficacement les messages et les données avant de les envoyer à une IA ?
Avant d’envoyer des documents confidentiels à un modèle de langage, préparez-les en supprimant les informations sensibles. Vous pourrez ainsi travailler sur leur contenu sans risquer de divulguer des données confidentielles.
Suppression des identifiants et tokenisation
La tokenisation consiste à remplacer des données sensibles par des substituts artificiels. On peut, par exemple, remplacer « Jean Dupont » par « [Client_1] » et « Société ABC » par « [Organisation_A] ». Le modèle de langage conserve ainsi la structure, la syntaxe et le contexte du document, sans pouvoir identifier directement les personnes ou organisations d’origine.
Techniques de masquage des informations sensibles
Le masquage consiste à cacher les suites de caractères critiques, généralement en les remplaçant par des caractères spéciaux, comme dans le numéro de carte 4532 **** **** ****. La généralisation est également utile : au lieu d’indiquer un montant exact, par exemple un salaire de 3 200 €, on donne une fourchette, comme « un salaire compris entre 3 000 et 4 000 € ». Cela réduit le risque de réidentification.
Automatiser le processus avec des outils DLP et RegEx
Supprimer manuellement les informations sensibles d’un long texte expose à des oublis. Dans un cadre professionnel, on utilise des scripts fondés sur des expressions régulières (RegEx) ou des outils DLP (Data Loss Prevention). Avant l’envoi d’une requête, ils peuvent la parcourir automatiquement pour détecter, bloquer ou remplacer des suites de caractères correspondant notamment à des numéros de sécurité sociale, des numéros de TVA, des adresses e-mail ou des coordonnées bancaires.
Données partagées avec l’IA : comment empêcher leur utilisation pour entraîner les modèles ?
Configurer l’outil lui-même permet aussi de limiter les risques liés aux informations saisies. La plupart des fournisseurs proposent une option de refus de l’utilisation des contenus pour l’entraînement.
- ChatGPT (OpenAI) – dans les paramètres du compte (« Settings »), la rubrique « Data controls » contient l’option « Improve the model for everyone ». Sa désactivation empêche l’utilisation des nouveaux textes saisis pour entraîner le modèle. Dans la version actuelle de l’interface, les conversations restent visibles dans l’historique. Indépendamment de ce réglage, OpenAI peut conserver des journaux sur ses serveurs pendant 30 jours à des fins de sécurité et de détection des abus avant leur suppression définitive.
- Gemini (Google) – dans les paramètres de confidentialité, désactivez « Gemini Apps Activity ». Les nouvelles conversations ne sont alors plus enregistrées dans votre compte Google ni utilisées pour entraîner les modèles. Ce changement ne supprime toutefois pas immédiatement les journaux de l’infrastructure du fournisseur : Google peut les conserver jusqu’à 72 heures pour assurer la sécurité du service.
- Claude (Anthropic) – les versions grand public gratuites et standard peuvent utiliser par défaut les données saisies pour améliorer les modèles. Il s’agit d’un changement notable par rapport aux débuts d’Anthropic, lorsque l’entreprise mettait en avant le fait qu’elle n’utilisait pas les conversations des utilisateurs à des fins d’entraînement. Pour désactiver ce mécanisme, ouvrez la rubrique de confidentialité des paramètres du compte et désactivez « Help improve Claude ».
Gardez à l’esprit que les changements apportés aux paramètres de confidentialité et le refus de l’entraînement ne s’appliquent qu’aux données futures. Ils ne permettent pas de retirer rétroactivement les informations déjà intégrées à un cycle d’entraînement.
Résumé
- Traitez chaque interaction avec une IA grand public comme si son contenu pouvait devenir public : n’y saisissez ni données personnelles, ni dossiers médicaux, ni mots de passe, ni secrets commerciaux.
- Les informations transmises peuvent être utilisées à différentes étapes : entraînement des modèles, modération et conservation de sauvegardes sur des serveurs externes.
- Avant d’utiliser un modèle, protégez vos textes par l’anonymisation, le masquage des données sensibles et la tokenisation, éventuellement à l’aide d’outils DLP.
- Les offres Enterprise et les environnements cloud professionnels dédiés proposent des protections plus strictes et peuvent exclure l’utilisation des données clients pour l’entraînement.
- Modifier les paramètres de confidentialité et refuser l’utilisation des données pour l’entraînement n’a d’effet que pour l’avenir : ces actions ne retirent pas les données déjà intégrées à un cycle d’entraînement.
Laisser un commentaire