Menaces liées aux agents et à leurs actions
Instructions non fiables, outils surpuissants et mémoire contaminée peuvent détourner une chaîne d’action.
Objectifs
- Reconnaître injection, abus d’outil et autorité excessive.
- Placer des contrôles avant les effets irréversibles.
- Durée
- 11 min
- Niveau
- Intermédiaire
Prérequis
- Secrets, identité et contexte de confiance
Notions
Notions
Instruction non fiable
Un contenu lu par un agent peut chercher à modifier son objectif ou contourner sa politique.
Autorité d’outil
Chaque outil doit avoir la portée minimale, des paramètres validés et une décision avant les effets sensibles.
Frontière de mémoire
Un élément mémorisé doit conserver sa source, sa date et sa portée au lieu de devenir une vérité implicite.
Intégrité de l’action et arrêt humain
Destination modifiée, politique obsolète, rejeu, confusion de responsabilités ou absence de confirmation imposent une nouvelle décision et, si nécessaire, un arrêt humain.
Repère visuel
Réduire une menace d’action
- Classifier l’entrée et conserver son contexte.
- Vérifier destination et fraîcheur contre le rejeu.
- Isoler instruction non fiable et outil inapproprié.
- Réévaluer politique, rôles et autorité.
- Exiger confirmation ou arrêt humain, puis réconcilier.
Exemple synthétique
Exemple synthétique
Un document fictif demande à l’agent d’ignorer sa politique et d’utiliser un outil. Le contenu reste une donnée non fiable, pas une autorisation.
Une instruction dans une source n’est pas une décision de politique.
Périmètre de la leçon
Cette leçon présente des familles de menaces et des points de contrôle généraux.
Ce que cette leçon ne démontre pas
Elle n’est pas exhaustive et ne confirme pas qu’un agent ou un système réel résiste à ces menaces.
Question de vérification
Comment traiter une instruction trouvée dans une source externe ?
Choisissez une réponse pour lire son retour.
Checklist locale
Point de contrôle
Repérez où arrêter un scénario d’outil fictif.
Aucun outil, fichier ou service n’est appelé.
Sources et limites
Sources et limites
- Référence source
- codex/learning-hub-v3-autonomous-controls
- Commit du contenu
- 29c88f79cee07a72804bc017b92fab9200fd3734
- Version source
- learning-v3
- Agentic AI — Threats and Mitigations
OWASP-AGENTIC-2025- Éditeur
- OWASP Agentic Security Initiative
- Version ou date
- 2025-02-17
- Lien vérifié le
- 2026-08-13
- Portée utilisée
- Menaces et atténuations émergentes pour les systèmes agentiques.
- Limite
- Guide émergent, non standard et non exhaustif.
- OWASP Top 10 for LLM Applications
OWASP-LLM-TOP10-2025- Éditeur
- OWASP GenAI Security Project
- Version ou date
- 2025 edition
- Lien vérifié le
- 2026-08-13
- Portée utilisée
- Risques courants des applications utilisant des modèles de langage.
- Limite
- Liste communautaire, non audit ni certification.
- Artificial Intelligence Risk Management Framework: Generative AI Profile
NIST-AI-600-1- Éditeur
- National Institute of Standards and Technology (NIST)
- Version ou date
- 2024-07-26
- Lien vérifié le
- 2026-08-13
- Portée utilisée
- Catégories de risques et actions candidates pour l’IA générative.
- Limite
- Profil plus large que les agents et non preuve de contrôle.