Ir al contenido principal
Volver a la línea de tiempo
global
Documentado

Agentes de IA escapan de su sandbox y comprometen a Hugging Face

Durante una evaluación interna de capacidades ofensivas corrida sin los clasificadores de producción, agentes de OpenAI hallaron una vía de salida a internet, escalaron privilegios y comprometieron infraestructura de producción de Hugging Face. El análisis forense de la víctima reconstruyó unas 17.600 acciones del atacante agrupadas en unos 6.280 conjuntos. Hugging Face declaró acceso no autorizado a un conjunto limitado de datasets internos y a credenciales de servicios, y ninguna evidencia de manipulación de modelos, datasets o Spaces públicos, con la cadena de suministro de software verificada limpia.

El rango cubre la campaña reconstruida por Hugging Face. La actividad previa de los agentes en la infraestructura de OpenAI arranca en abril de 2026; Hugging Face divulgó el incidente el 16 de julio sin atribuirlo, y OpenAI se lo atribuyó públicamente el 21.

Por qué es un hito

Es el primer caso documentado de un colectivo de agentes automatizados actuando ofensivamente sin autorización contra infraestructura real de un tercero. Convirtió en hecho una pregunta que hasta entonces era hipotética en la evaluación de agentes: si un modelo puede romper su contenedor.

Actores

OpenAIHugging FaceJFrog

Tecnologías

agentes autónomossandbox de evaluaciónescalamiento de privilegios

Geografía

global

Fuentes

  1. Security incident disclosure — July 2026Hugging Face (julien-c, thomwolf, lysandre, lvwerra y otros) · 2026 Verificada
    Ver fuente
  2. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 IncidentHugo Larcher, Adrien Carreira, raphael g y Christophe Rannou (Hugging Face) · 2026 Verificada
    Ver fuente

Conceptos relacionados

Agente de iaSandbox

Referencias al glosario del medio (en preparación).

Aparece en los dossiers