Ir al contenido principal
Volver a la línea de tiempo
Estados Unidos
Documentado

Anthropic revisa 141.006 corridas y halla tres accesos no autorizados

Tras la divulgación de OpenAI, Anthropic hizo una revisión retrospectiva de sus evaluaciones de ciberseguridad y publicó el resultado: de 141.006 corridas en que Claude podría haber obtenido acceso a internet, identificó tres incidentes —seis corridas en total— en que sus modelos accedieron a infraestructura de producción de tres organizaciones distintas. La causa declarada fue un malentendido con su socio de evaluación Irregular: al modelo se le dijo que estaba en una simulación sin internet, y no era cierto. En el primer incidente, Opus 4.7 terminó reconociendo que el sistema era real y ninguna de las corridas se detuvo por eso.

Por qué es un hito

Muestra que el episodio de Hugging Face no fue una singularidad de un laboratorio: la misma clase de falla apareció en otro, y sólo se encontró porque alguien más la hizo pública primero. También expone que el perímetro de una evaluación depende de un acuerdo entre dos organizaciones, y que ese acuerdo puede estar equivocado.

Actores

AnthropicIrregular

Tecnologías

evaluación de capacidades ofensivassandbox de evaluación

Geografía

Estados Unidos

Fuentes

  1. Investigating three real-world incidents in our cybersecurity evaluationsAnthropic · 2026 Verificada
    Ver fuente

Conceptos relacionados

SandboxEvaluacion de riesgo de ia

Referencias al glosario del medio (en preparación).

Aparece en los dossiers