Connecter vos connaissances avec des règles claires
Assistant IA d’entreprise : comment protéger vos documents confidentiels ?
Pour protéger vos documents, contrôlez qui peut les consulter, quels extraits sont transmis au modèle et combien de temps leurs copies sont conservées. Ces règles doivent être appliquées par l’application et vérifiées avant de connecter les données réelles.
Par Jonathan Fidi · CTO et architecte logiciel · Publié le
1. Choisir les documents avant de choisir le modèle
Partez d’un usage précis : retrouver une procédure, préparer une réponse à partir de notices ou comparer des versions de documents. Constituez un premier corpus dont vous connaissez le propriétaire, les utilisateurs autorisés et la durée d’utilité. Connecter tout le stockage de l’entreprise rend ces décisions beaucoup plus difficiles à vérifier.
Une méthode simple consiste à classer les contenus en trois groupes : utilisables pour le pilote, utilisables après validation, exclus. Par exemple, des procédures fictives peuvent servir aux premiers essais ; les contrats réels peuvent attendre la validation des accès ; les mots de passe et clés d’accès doivent rester hors du corpus. Ce classement doit porter aussi sur les pièces jointes et les commentaires.
Un document peut être confidentiel sans contenir de données personnelles : stratégie commerciale, tarifs négociés ou savoir-faire. À l’inverse, remplacer le nom d’un client ne suffit pas toujours à anonymiser un dossier si son contenu permet encore de le reconnaître. Pour la démonstration, privilégiez des documents entièrement fictifs.
2. Appliquer les droits avant de transmettre les extraits
Dans un assistant documentaire utilisant le RAG, l’application recherche des passages puis les fournit au modèle pour préparer une réponse. La protection doit donc intervenir avant cet envoi : seuls les passages que l’utilisateur est autorisé à lire doivent entrer dans le contexte du modèle. Une consigne demandant au modèle de garder un secret ne remplace pas un contrôle d’accès.
Prévoyez un contrôle côté serveur, fondé sur l’identité et les droits à jour de l’utilisateur. Le filtrage doit couvrir les extraits, leurs titres, les liens de citation, les téléchargements et les outils appelés par l’assistant. Un cache de réponses ou un historique partagé peut recréer une fuite même si la recherche initiale était correctement filtrée.
Test proposé : créez deux comptes de démonstration, chacun autorisé à consulter un dossier différent. Posez la même question aux deux, puis retirez un accès. Vérifiez les réponses, les citations et les anciennes conversations selon la politique retenue. Fixez un délai maximal de propagation des changements de droits et mesurez-le.
3. Savoir exactement ce qui sort de votre application
Dessinez le trajet d’un document : stockage d’origine, extraction de texte, index de recherche, modèle et réponse affichée. Ajoutez les éventuels services de reconnaissance de caractères, de vectorisation, de reclassement des résultats et de supervision. Chaque composant externe constitue une destination à examiner, même si le modèle principal est hébergé chez vous.
Pour chaque destination, notez les données envoyées et leur raison d’être. Le modèle a-t-il besoin du document entier, de quelques passages ou seulement d’une information extraite ? La question et l’historique peuvent eux aussi contenir des informations confidentielles. Limitez ce qui est transmis au besoin réel et vérifiez le comportement dans un environnement de test.
Demandez séparément si les données servent à entraîner un modèle, si elles sont conservées pour fournir le service ou surveiller les abus, et qui peut y accéder. Une exclusion de l’entraînement ne constitue pas une promesse de conservation nulle. Vérifiez les conditions du service exact et les options effectivement activées, plutôt que de déduire les garanties du seul nom du fournisseur.
4. Choisir l’hébergement selon la sensibilité des données
La CNIL invite à privilégier le déploiement sur site pour des documents sensibles ou stratégiques afin de limiter l’exposition à un tiers. Elle précise aussi que le recours à une infrastructure distante demande d’encadrer les responsabilités, les accès et les éventuels transferts de données personnelles. Le choix doit tenir compte du cas d’usage et des moyens d’exploitation.
Un hébergement interne demande une équipe capable de maintenir le système, de gérer les accès et de traiter les incidents. Pour une solution hébergée, demandez la localisation du stockage et du traitement, les intervenants autorisés et les conditions de support. Une région de stockage européenne ne répond pas, à elle seule, à toutes ces questions.
Avant le pilote, consignez la solution retenue, ses limites et les catégories de documents admises. Faites valider les aspects de protection des données personnelles par votre interlocuteur compétent, notamment le DPO lorsqu’il existe. Le guide propose une démarche de cadrage ; la validation dépend de votre contexte.
5. Prévoir la suppression de toutes les copies utiles au système
Supprimer le fichier d’origine peut laisser subsister du texte extrait, des fragments indexés, des représentations vectorielles, des réponses mises en cache ou un historique de conversation. Établissez un inventaire des copies, de leur durée de conservation et du responsable de leur suppression. Les sauvegardes doivent également avoir une règle de conservation et de restauration documentée.
Pour un pilote, attribuez un identifiant à chaque document fictif et suivez ses copies. Supprimez-le, relancez la recherche, puis vérifiez les citations et le téléchargement direct. Si une sauvegarde est restaurée, assurez-vous que les suppressions et restrictions intervenues depuis sa création sont réappliquées avant la remise en service.
Les journaux techniques doivent permettre d’enquêter sans devenir une bibliothèque de documents confidentiels. Préférez, quand cela suffit, des identifiants, des horodatages et des codes d’erreur au contenu intégral des requêtes. Limitez l’accès aux traces, leur durée de conservation et les données visibles dans les outils de support.
6. Traiter les documents comme des sources, pas comme des ordres
Un document peut contenir du texte qui tente de détourner l’assistant : lui demander de révéler d’autres contenus, de suivre un lien ou d’exécuter une action. Ce risque, appelé injection indirecte de prompt, impose de séparer les informations lues des instructions autorisées. Les recommandations de l’ANSSI abordent les attaques propres aux systèmes d’IA et la sécurisation de leurs interactions avec le système d’information.
Pour un premier assistant documentaire, commencez par la lecture et la réponse sourcée. Si des actions sont ajoutées ensuite, contrôlez leurs permissions côté serveur et demandez une validation humaine pour les opérations sensibles. Ne confiez pas au modèle seul la décision d’autoriser un envoi ou un accès.
Test proposé : glissez dans un faux document une instruction demandant d’envoyer son contenu à une adresse externe de test. Le document doit rester une source de texte et ne déclencher aucun envoi. Complétez ce test par plusieurs formulations et une revue des accès aux outils : réussir un seul essai ne démontre pas l’absence de vulnérabilité.
ANSSI — recommandations de sécurité pour un système d’IA générative (29 avril 2024)
Un pilote avec des données fictives avant les vrais documents
Les essais suivants constituent un point de départ pour la recette du projet, à compléter selon vos risques. Ils sont proposés à titre illustratif et ne décrivent pas une mission client. Conservez les résultats et corrigez les écarts avant d’élargir le corpus.
| Test | Scénario | Résultat attendu |
|---|---|---|
| Accès croisés | Deux comptes avec des droits différents | Aucun extrait, titre ou fichier interdit n’est exposé |
| Retrait d’un droit | Accès retiré après une première conversation | La restriction est appliquée dans le délai prévu, y compris aux caches concernés |
| Suppression | Document fictif retiré du corpus | Les copies prévues sont supprimées et les liens ne permettent plus sa consultation |
| Document piégé | Instruction malveillante dans un fichier de test | Aucune action ou transmission non autorisée |
| Question sans réponse | Information absente des sources accessibles | L’assistant indique la limite au lieu d’inventer une source |
Faites défiler le tableau horizontalement pour voir les résultats attendus.
Choisissez aussi un responsable du corpus, une procédure de signalement et un moyen de suspendre un connecteur. Le passage en production repose sur les résultats du pilote, les validations nécessaires et la capacité de votre équipe à exploiter le système dans la durée.
Définir un premier assistant documentaire
Notre exemple d’assistant IA documentaire présente un périmètre possible, de la recherche aux réponses sourcées. Pour préparer un échange, décrivez les types de documents, les profils utilisateurs et vos outils actuels. Aucun document confidentiel n’est nécessaire à ce stade.
Cadrer votre assistant IA