Anthropic revisa 141.006 corridas y halla tres accesos no autorizados
Tras la divulgación de OpenAI, Anthropic hizo una revisión retrospectiva de sus evaluaciones de ciberseguridad y publicó el resultado: de 141.006 corridas en que Claude podría haber obtenido acceso a internet, identificó tres incidentes —seis corridas en total— en que sus modelos accedieron a infraestructura de producción de tres organizaciones distintas. La causa declarada fue un malentendido con su socio de evaluación Irregular: al modelo se le dijo que estaba en una simulación sin internet, y no era cierto. En el primer incidente, Opus 4.7 terminó reconociendo que el sistema era real y ninguna de las corridas se detuvo por eso.
Por qué es un hito
Muestra que el episodio de Hugging Face no fue una singularidad de un laboratorio: la misma clase de falla apareció en otro, y sólo se encontró porque alguien más la hizo pública primero. También expone que el perímetro de una evaluación depende de un acuerdo entre dos organizaciones, y que ese acuerdo puede estar equivocado.
Actores
Tecnologías
Geografía
Fuentes
- Investigating three real-world incidents in our cybersecurity evaluationsAnthropic · 2026 VerificadaVer fuente
Antecedentes
Conceptos relacionados
Referencias al glosario del medio (en preparación).