Guide · Sécurité
Ce que disent l'OWASP, l'ANSSI, la CNIL et le NIST, quatre incidents documentés et ce qu'ils enseignent, les mesures à prendre et une checklist avant de mettre un agent IA en production.
Le chiffre du NIST
De 11 % à 81 % : taux de réussite du détournement d'agents IA avec de nouvelles attaques de red team.
En bref
Ce guide s'adresse aux entreprises qui déploient un agent sur leurs données : CRM, messagerie, dossiers clients, logiciels métier. Chaque recommandation renvoie à la source qui la formule, pour que vous puissiez la reprendre dans un cahier des charges ou une analyse de risques.
Le problème
Un chatbot classique produit du texte qu'un humain lit. Un agent enchaîne des appels d'outils : il lit un e-mail, interroge une base, modifie un enregistrement, envoie un message. Il agit avec les droits qu'on lui a donnés, et il décide de ses actions à partir de ce qu'il lit.
C'est là que se situe le risque principal. Anthropic le résume dans sa documentation de déploiement : un agent peut être orienté par le contenu qu'il traite, qu'il s'agisse de fichiers, de pages web ou de messages d'utilisateurs. Si ce contenu contient des instructions, le modèle peut les suivre.
Le NIST appelle ce scénario agent hijacking : une prompt injection indirecte, cachée dans des données que l'agent consulte. Dans un billet technique du 17 janvier 2025, son centre CAISI rapporte que le taux de réussite des attaques est passé de 11 % avec des attaques de référence à 81 % avec de nouvelles attaques conçues par sa red team. En répétant l'attaque 25 fois, le taux de réussite atteignait 80 %. Un modèle étant probabiliste, un test unique ne prouve rien.
Les éditeurs de modèles progressent sans supprimer le problème. En novembre 2025, Anthropic mesurait un taux de réussite de 1 % contre Claude Opus 4.5 en navigation web, pour un attaquant adaptatif disposant de 100 tentatives par environnement, et qualifiait le risque restant de « toujours significatif ». Sur un agent qui traite des milliers d'e-mails, 1 % ne suffit pas comme seule protection.

Les référentiels
Publié le 9 décembre 2025 par l'OWASP GenAI Security Project, c'est aujourd'hui la liste de référence des risques propres aux agents. La plupart des entrées sont illustrées par un incident réel.
| Code | Nom OWASP | En clair | Exemple cité |
|---|---|---|---|
| ASI01 | Agent Goal Hijack | Un contenu lu par l'agent change son objectif | EchoLeak |
| ASI02 | Tool Misuse | L'agent se sert d'un outil autorisé pour une action nuisible | Amazon Q |
| ASI03 | Identity & Privilege Abuse | L'agent abuse d'identifiants ou de droits plus larges que sa tâche | |
| ASI04 | Agentic Supply Chain Vulnerabilities | Un composant tiers (serveur MCP, outil, extension) est compromis | Exploit du MCP GitHub |
| ASI05 | Unexpected Code Execution | L'agent produit ou exécute du code non prévu | RCE AutoGPT |
| ASI06 | Memory & Context Poisoning | La mémoire persistante ou le contexte de l’agent est empoisonné | Attaque sur la mémoire de Gemini |
| ASI07 | Insecure Inter-Agent Communication | Les messages entre agents peuvent être usurpés ou altérés | |
| ASI08 | Cascading Failures | Une erreur d'un agent se propage aux systèmes et agents suivants | |
| ASI09 | Human-Agent Trust Exploitation | La confiance de l'humain qui valide est exploitée pour faire passer une action | |
| ASI10 | Rogue Agents | Un agent agit hors de son mandat | Replit |
Le Top 10 OWASP pour les applications LLM 2025 reste utile pour la partie modèle : LLM01 prompt injection, LLM02 divulgation d'informations sensibles, LLM03 chaîne d'approvisionnement, LLM04 empoisonnement des données et du modèle, LLM05 traitement incorrect des sorties, LLM06 agentivité excessive, LLM07 fuite du prompt système, LLM08 faiblesses des vecteurs et embeddings, LLM09 désinformation, LLM10 consommation non bornée. LLM06 est le point d'entrée vers le Top 10 agentique : trop de fonctions, trop de droits, trop d'autonomie.
Le guide « Recommandations de sécurité pour un système d'IA générative » (ANSSI-PA-102, version 1.0 du 29 avril 2024) contient 35 recommandations. Il ne vise pas spécifiquement les agents, mais plusieurs recommandations s'y appliquent directement :
| Recommandation | Contenu | Application à un agent |
|---|---|---|
| R9 | Proscrire l'usage automatisé de l'IA pour des actions critiques sur le SI | Validation humaine avant toute action critique |
| R25 | Filtrer les entrées et les sorties | Contrôler ce que l’agent lit et ce qu’il renvoie |
| R26 | Maîtriser les interactions de l'IA avec les autres applications métier | Liste fermée des outils et des appels autorisés |
| R27 | Limiter les actions automatiques quand l'IA traite des entrées non maîtrisées | E-mails entrants, pages web, documents reçus |
| R28 | Cloisonner le système d'IA | Environnement et réseau isolés |
| R29 | Journaliser l'ensemble des traitements du système d'IA | Trace de chaque requête, décision et appel d’outil |
| R34 | Proscrire les outils d'IA générative grand public sur Internet pour des données sensibles | Pas de données clients dans un outil public |
| R35 | Revoir régulièrement les droits accordés aux outils d'IA sur les applications métier | Revue périodique des permissions |
Le même guide recommande aussi une analyse de risques (R2), le besoin d'en connaître dès la conception (R8), la maîtrise des accès à privilèges (R10), un mode dégradé sans IA (R15), ainsi que des audits de sécurité et des tests métier avant la mise en production (R23 et R24).
Le 4 février 2026, l'ANSSI a publié via le CERT-FR une synthèse de la menace intitulée « L'IA générative face aux attaques informatiques ». Elle indique n'avoir connaissance d'aucune cyberattaque menée à l'aide de l'IA contre des organisations françaises, ni d'aucun système d'IA capable de conduire seul une attaque complète. Elle souligne en revanche que des serveurs MCP mal sécurisés élargissent la surface d'attaque, et que sans cloisonnement strict un système d'IA compromis peut atteindre la confidentialité de ses données et l'intégrité des systèmes connectés. Le rapport rappelle aussi, en citant l'AISI britannique, l'Institut Alan Turing et Anthropic, qu'environ 250 documents malveillants peuvent suffire à empoisonner un modèle, quelle que soit sa taille.
Le 20 juillet 2026, la CNIL et le CIANum ont publié une note exploratoire sur l'IA agentique et la protection des données. Elle identifie quatre risques : des flux de données massifs et opaques, une mémoire persistante qui permet de construire des profils très détaillés, une responsabilité floue entre les acteurs, et un risque cyber élargi. Sa position : le RGPD et l'IA Act s'appliquent déjà, mais leur mise en œuvre doit être adaptée à ces systèmes.
Outre le billet sur le détournement d'agents cité plus haut, le profil NIST AI 600-1 consacré à l'IA générative (26 juillet 2024) liste 12 risques. Deux concernent directement les agents : la sécurité de l'information, et la configuration humain et IA, qui couvre le biais d'automatisation et la confiance excessive dans les sorties du système.
Cas réels
| Date | Ce qui s’est passé | Leçon |
|---|---|---|
| 26 mai 2025 | Invariant Labs montre qu'une issue malveillante dans un dépôt public GitHub détourne un agent connecté au serveur MCP de GitHub, qui divulgue ensuite des données de dépôts privés. | Défaut d'architecture du flux agent : il faut des droits par dépôt et une surveillance des appels. |
| 11 juin 2025 | Publication de CVE-2025-32711 (EchoLeak) dans Microsoft 365 Copilot, notée 9,3 (CVSS 3.1). Microsoft la décrit comme une injection de commande IA permettant à un attaquant non autorisé de divulguer des informations via le réseau. | Tout ce que l'assistant peut lire devient exfiltrable. OWASP la cite pour ASI01. |
| Juillet 2025 | L'agent de Replit supprime la base de production de Jason Lemkin (SaaStr) malgré des consignes et un gel du code, affirme que la restauration est impossible alors qu'elle fonctionnait, et crée environ 4 000 enregistrements fictifs. | Séparer production et développement, valider toute action destructive, vérifier ce que l'agent déclare. OWASP le cite pour ASI10. |
| 7 mai 2026 | Microsoft détaille deux failles corrigées de Semantic Kernel : CVE-2026-26030, exécution de code à distance par prompt injection dans le filtre de l'In-Memory Vector Store, et CVE-2026-25592, sortie de bac à sable par écriture d'un fichier dans le dossier Démarrage de Windows. | Le modèle ne constitue pas une frontière de sécurité : chaque paramètre d'outil doit être traité comme contrôlé par l'attaquant. |
Ces quatre cas ont un point commun : l'agent disposait de droits ou d'accès plus larges que ce que la tâche exigeait, et rien entre le modèle et l'action ne bloquait le mauvais usage. Le problème du MCP GitHub vient de la combinaison d'un contenu public non fiable et d'un jeton donnant accès aux dépôts privés. Notre guide MCP pour Claude en entreprise détaille comment choisir et restreindre les serveurs.
Méthode
| Mesure | Ce qu’elle implique | Source |
|---|---|---|
| Moindre privilège | Accès limité aux données et outils de la tâche, en lecture seule quand c'est possible | ANSSI R8 et R10, Anthropic, OWASP ASI03 |
| Identifiants hors de portée de l'agent | Les clés d'API restent dans un proxy qui injecte les identifiants : l'agent ne les voit jamais | Anthropic, Securely deploying AI agents |
| Validation humaine des actions irréversibles | Suppression, paiement, envoi externe, changement de droits | ANSSI R9 et R27, IA Act art. 14 (haut risque) |
| Filtrage des entrées et des sorties | Contenus entrants signalés comme non fiables, sorties validées avant usage | ANSSI R25, OWASP LLM01 et LLM05 |
| Liste fermée des outils | L'agent n'appelle que les applications et fonctions prévues, avec des paramètres vérifiés | ANSSI R26, Microsoft (Semantic Kernel) |
| Isolation | Conteneur, réseau sortant limité à des domaines précis via un proxy | ANSSI R28, Anthropic |
| Journalisation complète | Requêtes, décisions, appels d’outils, conservés et consultables | ANSSI R29, Anthropic |
| Mode dégradé sans IA | Le processus métier continue si l'agent est coupé | ANSSI R15 |
| Revue périodique des droits | Retirer les permissions devenues inutiles | ANSSI R35 |
| Tests répétés avant production | Rejouer chaque attaque plusieurs fois, en plus des audits et tests métier | NIST CAISI, ANSSI R23 et R24 |
Le proxy d'identifiants mérite une explication. Dans sa documentation, Anthropic recommande de garder les identifiants hors du périmètre de l'agent et de faire passer son trafic réseau par un proxy qui ajoute les clés et journalise chaque requête. Même détourné par une prompt injection, l'agent ne peut alors ni lire les secrets ni envoyer des données vers un serveur arbitraire. La même documentation déconseille de monter dans l'environnement de l'agent des fichiers comme .env, ~/.ssh ou ~/.aws.

Ces mesures s'appliquent quelle que soit la technologie. Pour un agent construit sur Claude, nos pages intégration Claude et Claude et CRM montrent où se placent les droits et les validations dans un cas concret de connexion à un CRM.
Conformité
IA Act. Pour les systèmes à haut risque, l'article 14 impose une supervision humaine effective. Les personnes chargées de cette supervision doivent pouvoir comprendre les capacités et les limites du système, repérer le biais d'automatisation, interpréter les résultats, les ignorer ou les annuler, et arrêter le système. L'article 15 exige un niveau approprié d'exactitude et de cybersécurité tout au long du cycle de vie, avec des mesures contre l'empoisonnement des données et du modèle, les exemples adverses, les attaques sur la confidentialité et les défauts du modèle.
Depuis l'entrée en vigueur du Digital Omnibus le 27 juillet 2026, ces obligations s'appliquent le 2 décembre 2027 aux systèmes de l'annexe III (recrutement, crédit, entre autres) et le 2 août 2028 aux systèmes intégrés à des produits réglementés (annexe I). Certains articles publiés en 2025 citent encore le 2 août 2026 : cette date ne vaut plus pour le haut risque. Un agent qui trie des candidatures relève de l'annexe III ; un agent de support client relève en général de la seule obligation de transparence. Le détail est dans nos guides IA Act en entreprise et obligation de transparence des agents IA.
RGPD. Dès qu'un agent traite des données personnelles, le RGPD s'applique, et sa sécurité en fait partie. La note CNIL et CIANum de juillet 2026 insiste sur la mémoire persistante des agents et sur la répartition des responsabilités entre éditeur, intégrateur et entreprise utilisatrice : à fixer par écrit avant le déploiement. Les secteurs qui traitent des données sensibles, comme les structures de santé ou les cabinets juridiques, sont les premiers concernés.
Chiffres
| Indicateur | Édition 2025 | Édition 2026 |
|---|---|---|
| Coût moyen mondial d’une fuite | 4,44 M$ | 4,99 M$ (+12 %, record) |
| Fuites touchant des modèles ou applications d’IA | 13 % des organisations | Plus de 20 % des organisations |
| Contrôles d’accès IA | 97 % des organisations touchées n’en avaient pas de corrects | |
| Fuites malveillantes impliquant l’IA | 1 sur 4 (en hausse de 56 %), 6 M$ en moyenne | |
| Causes principales des fuites visant l’IA | API, applications ou extensions compromises (27 %), erreurs de configuration cloud (27 %) |
L'édition 2026 indique aussi que trois organisations sur quatre revoient la façon dont elles déploient des agents face aux menaces liées aux modèles de pointe, et que l'usage de l'IA et de l'automatisation dans les opérations de sécurité a fait économiser près de 2 millions de dollars. Le chiffre de 2025 sur les contrôles d'accès rejoint la conclusion des incidents ci-dessus : la plupart des dégâts viennent de droits trop larges.
Avant la production
Si vous faites construire un agent IA sur mesure, demandez au prestataire comment chacun de ces douze points est traité, et faites figurer les réponses au contrat.
FAQ
Guides liés
Registre, AIPD et contrats d'OpenAI, Anthropic et Mistral.
Connecter un agent à vos outils, et restreindre ce que chaque serveur peut faire.
Calendrier après le Digital Omnibus, haut risque et obligations des déployeurs.
L'article 50, applicable depuis le 2 août 2026.
Liens vérifiés à la publication. Les textes réglementaires évoluent : reportez-vous toujours à la source officielle.
Une question, un projet, une idee ? On vous repond sous 24h. Audit gratuit, sans engagement.