Pourquoi l’IA change la sécurité
Un modèle de langage lit du texte et produit du texte. Il ne fait pas de différence stricte entre une instruction de son concepteur et une phrase trouvée dans un e-mail, une page web ou un fichier PDF. Tant qu’il ne fait que répondre, une manipulation donne une mauvaise réponse. Dès qu’il dispose d’outils — envoyer un message, lire un dossier, exécuter une commande, payer —, la même manipulation peut produire une action.
Microsoft le formule sans détour à propos de l’injection indirecte : c’est un risque inhérent à la modélisation probabiliste du langage, à la génération stochastique et à la souplesse linguistique des grands modèles. Les détecteurs aident, mais restent probabilistes ; c’est pourquoi la défense la plus solide consiste à limiter, de façon déterministe, ce qu’une manipulation réussie peut obtenir.
L’IA change aussi le rythme. L’ENISA observe dans son panorama 2026 que l’IA sert surtout à accélérer des techniques existantes — hameçonnage, fraude, logiciels malveillants — et qu’elle peut accroître la vitesse et l’ampleur des attaques ; le CERT-FR observe que des attaquants exploitent déjà les noms de paquets logiciels inventés par les assistants de code. Côté défense, le volume de code généré augmente plus vite que la capacité de relecture des équipes.
Les huit familles de risques
AXDIA a cartographié 51 risques à partir des référentiels publics. Ils se regroupent en huit familles, chacune détaillée dans un guide :
- Injections et manipulation du modèle : injection directe ou indirecte, contournement des règles, exposition du contexte caché — voir le guide sur l’injection de prompt.
- Données, secrets et clés : clés d’API dans un prompt ou dans le code, données personnelles dans les journaux, exfiltration — voir fuite de secrets et de données.
- Agents, outils et actions : autonomie excessive, permissions trop larges, actions irréversibles, boucles et coûts — voir la sécurité des agents IA.
- Sorties, code généré et confiance : code dangereux, commandes shell, hallucinations, sources inventées — voir code généré par l’IA.
- Entrées, fichiers et réseau : fichiers piégés, requêtes forgées vers le réseau interne, chemins détournés.
- Chaîne d’approvisionnement et connaissances : connecteurs MCP, bases RAG, dépendances, modèles tiers — voir MCP et RAG.
- Sécurité applicative du code généré : contrôle d’accès, injections SQL, XSS, CSRF, authentification, selon l’OWASP Top 10:2025.
- Exploitation, coûts et environnements : factures qui s’envolent, séparation test et production, journalisation, cas d’erreur.
Les référentiels à connaître
Inutile de tout lire : ces documents se recoupent largement. Les plus utiles pour une équipe qui construit avec l’IA :
- L’OWASP Top 10 for LLM Applications 2026, publié le 3 août 2026, qui classe les dix risques majeurs des applications fondées sur un modèle de langage ; nous l’expliquons dans le guide OWASP Top 10 LLM 2026.
- L’OWASP Top 10 for Agentic Applications 2026, consacré aux agents qui agissent avec des outils et de la mémoire.
- L’OWASP Top 10:2025 pour les applications web, qui reste la grille de lecture du code généré.
- MITRE ATLAS, la base des techniques d’attaque contre les systèmes d’IA, dont l’injection de prompt (AML.T0051).
- Le NIST : profil IA générative du cadre de gestion des risques (AI 600-1) et taxonomie des attaques adverses (AI 100-2 E2025).
- L’ANSSI (recommandations pour un système d’IA générative) et le CERT-FR (synthèse de la menace liée à l’IA générative, février 2026), en français.
Six garde-fous à poser partout
- Les secrets ne passent jamais par le modèle. Ni dans un prompt, ni dans le code, ni dans un commit, ni dans un journal : variables d’environnement côté serveur et détection de secrets avant chaque commit.
- Le moindre privilège. Un agent ou un assistant reçoit les seuls droits nécessaires à sa mission, avec des comptes et des jetons dédiés.
- La validation humaine des actions sensibles. Supprimer, payer, envoyer à un client, modifier la production : une personne confirme, après avoir vu ce qui va se passer.
- Le contenu externe est une donnée, jamais un ordre. Pages web, e-mails, fichiers, résultats d’outils : on les lit, on ne leur obéit pas.
- Les sorties sont contrôlées. Schémas imposés, échappement avant affichage, relecture et tests du code généré, aucune commande exécutée sans examen.
- Tout est tracé et réversible. Journal des actions, environnements de test séparés, sauvegarde et retour arrière éprouvés.
Pour qui sont ces guides
Ils s’adressent aux dirigeants de TPE et de PME qui équipent leur équipe d’outils d’IA, aux développeurs qui travaillent avec Claude Code, Codex ou GitHub Copilot, et aux équipes qui déploient un chatbot ou un agent connecté aux données de l’entreprise. Chaque guide part d’exemples concrets, cite ses sources et se termine par une liste de contrôles à reprendre telle quelle. Pour un usage quotidien en entreprise, commencez par le guide sur les outils d’IA en entreprise ; pour un projet de développement, par celui sur les assistants de code.
Ce que Prompt OS ajoute à vos missions
Prompt OS transforme une idée en mission structurée pour un assistant de programmation. Sa section « Sécurité & garde-fous » propose 35 garde-fous en six familles : recommandations automatiques en mode Simple, options principales en mode Expert, réglage fin en mode Architecte. Chaque garde-fou actif ajoute ses propres consignes au prompt final, et un indicateur pédagogique — Faible, Standard, Renforcé ou Critique — montre ce qui manque.
Prompt OS rédige une mission : il n’exécute rien, ne voit pas votre dépôt et ne détecte pas une attaque en cours. Ces garde-fous réduisent les risques ; ils ne garantissent pas l’absence de vulnérabilités. La même méthode est disponible hors ligne dans la formation Prompt OS pour VS Code, gratuite et sans compte.
Conclusion
La sécurité de l’IA ne s’achète pas en une fois : c’est une façon de concevoir. Partez du principe que le modèle sera un jour trompé, puis faites en sorte que cette erreur reste sans gravité. Les huit guides ci-dessous détaillent comment, risque par risque.