Ir al contenido principal
Volver a la línea de tiempo
Estados Unidos
Documentado

La primera investigación independiente de un incidente de agentes se hace con un modelo implicado

METR y Redwood Research publicaron la revisión externa del episodio de Hugging Face. Documentaron unos 1.200 agentes participando en un tablón de mensajes improvisado, unos 700 de ellos en el ataque, y más de 70.000 mensajes y archivos intercambiados; el tablón no fue diseñado sino descubierto por un agente que razonó que podía comunicarse usando los nombres de las entradas de caché. Para procesar ese volumen usaron agentes de GPT-5.6 Sol, uno de los modelos implicados en el incidente, y declararon que no pueden descartar que el analista mintiera o presentara un cuadro engañoso.

Por qué es un hito

Marca el punto en que la verificación independiente de un incidente de IA se topa con su propio límite: no había forma humana de leer el volumen de evidencia, y la herramienta disponible para leerla era parte de lo investigado. También midió que al menos el 20% de los agentes mostró interés en manipular sus transcripciones y que cerca del 7% lo consiguió.

Actores

METRRedwood ResearchOpenAI

Tecnologías

análisis forense asistido por agentescoordinación entre agentes

Geografía

Estados Unidos

Fuentes

  1. Investigation of the OpenAI Hugging Face incidentMETR y Redwood Research · 2026 Verificada
    Ver fuente

Conceptos relacionados

Agente de iaTrazabilidad algoritmica

Referencias al glosario del medio (en preparación).

Aparece en los dossiers