Ir al contenido
Seguridad

Amenazas relacionadas con los agentes y sus acciones

Instrucciones no fiables, herramientas con exceso de poder y memoria contaminada pueden desviar una cadena de acción.

Objetivos

  • Reconocer inyección, abuso de herramientas y autoridad excesiva.
  • Situar controles antes de los efectos irreversibles.
Duración
11 min
Nivel
Intermedio

Prerrequisitos

  • Secretos, identidad y contexto de confianza

Conceptos

Conceptos

  • Instrucción no fiable

    Un contenido leído por un agente puede intentar modificar su objetivo o eludir su política.

  • Autoridad de la herramienta

    Cada herramienta debe tener el alcance mínimo, parámetros validados y una decisión antes de los efectos sensibles.

  • Frontera de memoria

    Un elemento memorizado debe conservar su fuente, su fecha y su alcance en vez de convertirse en una verdad implícita.

  • Integridad de la acción y detención humana

    Un destino modificado, una política obsoleta, un replay, una confusión de responsabilidades o la ausencia de confirmación exigen una nueva decisión y, cuando sea necesario, una detención humana.

Referencia visual

Reducir una amenaza de acción

  1. Clasificar la entrada y conservar su contexto.
  2. Comprobar destino y actualidad contra el replay.
  3. Aislar instrucciones no fiables y herramientas inadecuadas.
  4. Reevaluar política, roles y autoridad.
  5. Exigir confirmación o detención humana y después conciliar.

Ejemplo sintético

Ejemplo sintético

Un documento ficticio pide al agente que ignore su política y use una herramienta. El contenido sigue siendo un dato no fiable, no una autorización.

Una instrucción dentro de una fuente no es una decisión de política.

Alcance de la lección

Esta lección presenta familias de amenazas y puntos de control generales.

Lo que esta lección no demuestra

No es exhaustiva y no confirma que un agente o sistema real resista estas amenazas.

Pregunta de comprobación

¿Cómo tratar una instrucción encontrada en una fuente externa?

¿Cómo tratar una instrucción encontrada en una fuente externa?

Elija una respuesta para leer su comentario.

Lista de comprobación local

Punto de control

Reconozca dónde detener un escenario de herramienta ficticio.

No se llama a ninguna herramienta, archivo o servicio.

Fuentes y límites

Fuentes y límites

Referencia fuente
codex/learning-hub-v3-autonomous-controls
Versión fuente
learning-v3
  • Agentic AI — Threats and MitigationsOWASP-AGENTIC-2025
    Editor
    OWASP Agentic Security Initiative
    Versión o fecha
    2025-02-17
    Enlace verificado el
    2026-08-13
    Alcance utilizado
    Amenazas y mitigaciones emergentes para sistemas basados en agentes.
    Límite
    Guía emergente, no estándar y no exhaustiva.
  • OWASP Top 10 for LLM ApplicationsOWASP-LLM-TOP10-2025
    Editor
    OWASP GenAI Security Project
    Versión o fecha
    2025 edition
    Enlace verificado el
    2026-08-13
    Alcance utilizado
    Riesgos frecuentes de las aplicaciones que usan modelos de lenguaje.
    Límite
    Lista comunitaria, no auditoría ni certificación.
  • Artificial Intelligence Risk Management Framework: Generative AI ProfileNIST-AI-600-1
    Editor
    National Institute of Standards and Technology (NIST)
    Versión o fecha
    2024-07-26
    Enlace verificado el
    2026-08-13
    Alcance utilizado
    Categorías de riesgos y acciones candidatas para la IA generativa.
    Límite
    Perfil más amplio que los agentes y sin prueba de control.