Dossier
Seguridad de los agentes de IA
Cada salto de autonomía de la IA trajo un incidente que le puso nombre al riesgo: el chatbot Tay de Microsoft descontrolándose en horas (2016), los deepfakes abriendo la era de la desinformación hiperrealista (2017), el release escalonado de GPT-2 como admisión de que un modelo podía ser 'demasiado peligroso para publicar', y los agentes autónomos con LLM (AutoGPT, 2023) devolviendo la pregunta por el control. La seguridad de agentes es la suma de esas lecciones.
Este dossier reúne los hitos y los conceptos técnicos —alineamiento, sandbox, trazabilidad algorítmica— que articulan un debate que, como dice el corpus, es de gobernanza abierta, no un detalle resuelto.
Actualizado el 2 de agosto de 2026
Estado actual
El frente más activo es la evaluación de agentes en entornos aislados (sandboxes) y el registro auditable de decisiones (trazabilidad). Se investiga si los agentes pueden romper su contenedor y cuán predictiva es una prueba aislada del comportamiento real. La invariante de fondo —el ritmo de las capacidades vs. el de la investigación en seguridad— sigue siendo la tensión que define cuánto delegar.
Seguridad, alineamiento y control son relacionados pero no idénticos; y la seguridad de un agente se demuestra evaluándolo aislado, no asumiéndola.
En la línea de tiempo
Conceptos clave
Actores
- Bing
- comunidad de investigación en deep learning
- Microsoft (Tay)
- Microsoft Research
- OpenAI
- OpenAI (GPT-2)
- Significant Gravitas Ltd.
- Toran Bruce Richards
- UK AI Safety Institute
- usuarios de Reddit
Preguntas abiertas
- ¿El avance de las capacidades supera al de la investigación en seguridad, como sostienen algunos investigadores?
- ¿Una sandbox ofrece salvaguardias efectivas o funciona a veces como una vitrina?
- ¿La trazabilidad técnica basta para explicar decisiones complejas o deviene en teatro regulatorio?
Fuentes esenciales
- The Inspect Sandboxing Toolkit: Scalable and secure AI agent evaluations
UK AI Safety Institute (aisi.gov.uk) · 2025
- Regulation (EU) 2024/1689 (Artificial Intelligence Act)
Parlamento Europeo y Consejo (EUR-Lex) · 2024