Red teaming de IA
La práctica de atacar deliberadamente un modelo de IA antes de lanzarlo —con instrucciones adversariales, intentos de jailbreak o casos límite— para encontrar sus fallas de seguridad mientras todavía se pueden corregir.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
El término viene de la jerga militar y de ciberseguridad, donde un "equipo rojo" simula ser el adversario para poner a prueba las defensas de un sistema antes de que un atacante real lo haga. Aplicado a IA, un equipo de red teaming intenta deliberadamente que un modelo produzca contenido dañino, información peligrosa, respuestas sesgadas o comportamientos no previstos, usando trucos como reformular preguntas prohibidas, simular escenarios ficticios para eludir filtros, o encadenar instrucciones que el modelo no fue entrenado para rechazar.
Uno de los estudios más citados sobre red teaming aplicado a modelos de lenguaje es "Red Teaming Language Models to Reduce Harms" (Ganguli et al., 2022, Anthropic), que documentó a gran escala cómo distintos tamaños y tipos de modelo respondían a intentos adversariales, y qué tan bien distintas técnicas de mitigación (como el ajuste con retroalimentación humana) reducían esas fallas. La práctica se volvió, desde entonces, un paso esperado antes de lanzar un modelo grande, y marcos de gestión de riesgo como el NIST AI RMF (2023) la incluyen entre las prácticas recomendadas para medir el riesgo de un sistema de IA.
En términos accesibles, puede hacerlo un equipo humano —a veces con expertos en dominios específicos, como armas biológicas o ciberseguridad, para probar riesgos especializados—, un modelo de IA entrenado para atacar a otro modelo de forma automatizada, o una combinación de ambos. Cada falla encontrada se documenta, se prioriza según su gravedad, y retroalimenta el entrenamiento o los filtros del modelo antes de su lanzamiento público, y a menudo también después, de forma continua.
Es una etapa estándar en el ciclo de desarrollo de los modelos grandes de los principales laboratorios (OpenAI, Anthropic, Google DeepMind, entre otros), a veces complementada con programas que invitan a investigadores externos a intentar romper el modelo antes del lanzamiento, y con eventos públicos como desafíos de red teaming en conferencias de ciberseguridad.
El red teaming reduce fallas conocidas, pero no puede cubrir el espacio infinito de posibles usos indebidos, por lo que no es una garantía de seguridad sino una capa más dentro de un proceso de gestión de riesgo. También se discute la composición de los equipos —si reflejan la diversidad de formas en que distintos grupos de usuarios podrían intentar hacer mal uso del sistema— y el dilema de publicar o no las técnicas de ataque encontradas: hacerlo ayuda a que otros las corrijan, pero también les enseña a actores maliciosos cómo explotarlas.
¿Por qué te importa?
Que un modelo de IA se lance sin haber sido puesto a prueba deliberadamente por gente tratando de romperlo es un riesgo que hoy se considera evitable. El red teaming es, en buena parte, lo que separa un lanzamiento responsable de uno que descubre sus fallas de seguridad con usuarios reales de por medio.
Ejemplos
- Red Teaming Language Models to Reduce Harms (Ganguli et al., 2022, Anthropic), uno de los estudios a mayor escala sobre cómo atacar y mitigar fallas de modelos de lenguaje.
- Los programas de acceso anticipado que algunos laboratorios ofrecen a investigadores externos para intentar romper un modelo antes de su lanzamiento público.
- La inclusión del red teaming como práctica recomendada dentro del NIST AI Risk Management Framework (2023) para medir el riesgo de un sistema de IA.
Términos relacionados
Debate y controversia
Se discute si el red teaming, tal como se practica hoy, cubre una porción representativa de los posibles usos indebidos o sólo los más obvios, y si los equipos que lo realizan reflejan la diversidad de contextos culturales y lingüísticos en que un modelo termina usándose. También hay tensión documentada sobre publicar o no las técnicas de ataque descubiertas: informa a la comunidad de seguridad, pero también puede servir de manual a quien quiera explotarlas.
Fuentes
- Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned Verificada
Deep Ganguli et al. · 2022
WebFetch confirmó título exacto, autora principal (Deep Ganguli) y año 2022 (versión final de noviembre) en arXiv 2209.07858.
NIST (EE. UU.) · 2023
WebFetch confirmó la página oficial de NIST, marco publicado el 26 de enero de 2023, que incluye prácticas de evaluación adversarial (red teaming) dentro de la función 'Measure'.