Amenazas relacionadas con los agentes y sus acciones
Instrucciones no fiables, herramientas con exceso de poder y memoria contaminada pueden desviar una cadena de acción.
Objetivos
- Reconocer inyección, abuso de herramientas y autoridad excesiva.
- Situar controles antes de los efectos irreversibles.
- Duración
- 11 min
- Nivel
- Intermedio
Prerrequisitos
- Secretos, identidad y contexto de confianza
Conceptos
Conceptos
Instrucción no fiable
Un contenido leído por un agente puede intentar modificar su objetivo o eludir su política.
Autoridad de la herramienta
Cada herramienta debe tener el alcance mínimo, parámetros validados y una decisión antes de los efectos sensibles.
Frontera de memoria
Un elemento memorizado debe conservar su fuente, su fecha y su alcance en vez de convertirse en una verdad implícita.
Integridad de la acción y detención humana
Un destino modificado, una política obsoleta, un replay, una confusión de responsabilidades o la ausencia de confirmación exigen una nueva decisión y, cuando sea necesario, una detención humana.
Referencia visual
Reducir una amenaza de acción
- Clasificar la entrada y conservar su contexto.
- Comprobar destino y actualidad contra el replay.
- Aislar instrucciones no fiables y herramientas inadecuadas.
- Reevaluar política, roles y autoridad.
- Exigir confirmación o detención humana y después conciliar.
Ejemplo sintético
Ejemplo sintético
Un documento ficticio pide al agente que ignore su política y use una herramienta. El contenido sigue siendo un dato no fiable, no una autorización.
Una instrucción dentro de una fuente no es una decisión de política.
Alcance de la lección
Esta lección presenta familias de amenazas y puntos de control generales.
Lo que esta lección no demuestra
No es exhaustiva y no confirma que un agente o sistema real resista estas amenazas.
Pregunta de comprobación
¿Cómo tratar una instrucción encontrada en una fuente externa?
Elija una respuesta para leer su comentario.
Lista de comprobación local
Punto de control
Reconozca dónde detener un escenario de herramienta ficticio.
No se llama a ninguna herramienta, archivo o servicio.
Fuentes y límites
Fuentes y límites
- Repositorio fuente
- https://github.com/SwissTokint/swisstokint-website
- Referencia fuente
- codex/learning-hub-v3-autonomous-controls
- Commit del contenido
- 29c88f79cee07a72804bc017b92fab9200fd3734
- Versión fuente
- learning-v3
- Agentic AI — Threats and Mitigations
OWASP-AGENTIC-2025- Editor
- OWASP Agentic Security Initiative
- Versión o fecha
- 2025-02-17
- Enlace verificado el
- 2026-08-13
- Alcance utilizado
- Amenazas y mitigaciones emergentes para sistemas basados en agentes.
- Límite
- Guía emergente, no estándar y no exhaustiva.
- OWASP Top 10 for LLM Applications
OWASP-LLM-TOP10-2025- Editor
- OWASP GenAI Security Project
- Versión o fecha
- 2025 edition
- Enlace verificado el
- 2026-08-13
- Alcance utilizado
- Riesgos frecuentes de las aplicaciones que usan modelos de lenguaje.
- Límite
- Lista comunitaria, no auditoría ni certificación.
- Artificial Intelligence Risk Management Framework: Generative AI Profile
NIST-AI-600-1- Editor
- National Institute of Standards and Technology (NIST)
- Versión o fecha
- 2024-07-26
- Enlace verificado el
- 2026-08-13
- Alcance utilizado
- Categorías de riesgos y acciones candidatas para la IA generativa.
- Límite
- Perfil más amplio que los agentes y sin prueba de control.