Ir al contenido principal
Volver al Glosario

Evaluación de riesgo de IA

Las pruebas sistemáticas y adversariales que un laboratorio de IA de frontera —o un organismo externo— aplica a un modelo antes o después de lanzarlo, para detectar si puede facilitar daños graves como ciberataques, armas biológicas o acciones autónomas descontroladas.

Última revisión:
Fuentes:
4 fuentes · 4 verificadas

Evaluar un modelo de IA para riesgo no es lo mismo que medir su desempeño en un benchmark de razonamiento o codificación. Se trata de probar deliberadamente, bajo condiciones adversariales, si el modelo puede ser llevado a producir capacidades peligrosas: instrucciones de armamento, código de intrusión funcional, o comportamiento autónomo que evade la supervisión.

La práctica se formalizó recién a partir de 2023. Anthropic publicó ese año su Política de Escalamiento Responsable, que ata umbrales de capacidad ("niveles de seguridad de IA", ASL) a pruebas obligatorias antes de desplegar un modelo más capaz. En paralelo, gobiernos crearon institutos dedicados: el Reino Unido fundó su AI Security Institute (AISI) y Estados Unidos estableció un instituto equivalente dentro de NIST —hoy renombrado Center for AI Standards and Innovation (CAISI)—, ambos enfocados en evaluar modelos de frontera antes o después de su lanzamiento comercial.

En términos concretos, estas evaluaciones combinan "red-teaming" (expertos humanos, a veces con formación en bioseguridad o ciberseguridad, que intentan provocar respuestas peligrosas bajo presión adversarial) con benchmarks agénticos. Un ejemplo es el trabajo de METR, que mide el "horizonte temporal" de tareas que un agente de IA puede completar de forma autónoma sin supervisión, y ha documentado que esa duración se duplica cada pocos meses a medida que los modelos avanzan.

Hoy estas evaluaciones ocurren de forma rutinaria antes del lanzamiento de un modelo de frontera: el AISI del Reino Unido y el CAISI de NIST han realizado evaluaciones conjuntas de modelos recientes, y METR mantiene relaciones de evaluación con OpenAI, Anthropic, Google DeepMind y Meta, publicando informes de riesgo de frontera.

Lo que se discute con más fuerza es si la autoevaluación voluntaria de los propios laboratorios es suficiente, dado el conflicto de interés evidente, o si se necesitan auditorías externas vinculantes. También hay un giro documentado en el marco estadounidense: el instituto que nació enfocado en "seguridad" ahora se presenta oficialmente como el "punto de contacto principal de la industria" para facilitar pruebas, un cambio de énfasis desde la seguridad hacia la facilitación comercial que genera debate sobre si las evaluaciones siguen siendo un contrapeso independiente o se volvieron parte del aparato de la propia industria que evalúan.

¿Por qué te importa?

Antes de que un modelo con capacidades cada vez más agénticas llegue a tus manos, alguien decidió —con qué rigor, es la pregunta— si era seguro lanzarlo. Entender qué implica una evaluación de riesgo te permite distinguir un lanzamiento respaldado por pruebas reales de uno respaldado sólo por una nota de prensa.

Ejemplos

  • La Política de Escalamiento Responsable de Anthropic (2023), que define niveles de seguridad (ASL) y compromisos de no despliegue si un modelo muestra riesgo catastrófico bajo pruebas adversariales.
  • Las evaluaciones conjuntas del AI Security Institute del Reino Unido y el Center for AI Standards and Innovation de NIST (2026) sobre modelos de frontera recientes, enfocadas en capacidades de ciberseguridad.
  • El seguimiento de METR (2020-2026) del 'horizonte temporal' de tareas que agentes de IA completan de forma autónoma, en colaboración con OpenAI, Anthropic, Google DeepMind y Meta.

Términos relacionados

Debate y controversia

Se discute si la autoevaluación de los laboratorios —con el conflicto de interés evidente de evaluar su propio producto— es suficiente, frente a auditorías externas vinculantes. También hay debate sobre si las evaluaciones capturan riesgo real o son "showcasing de seguridad": pruebas que un modelo puede memorizar o sortear sin que eso implique menor riesgo real. El giro documentado del instituto estadounidense —de enfoque en "seguridad" a enfoque en "facilitar pruebas para la industria"— alimenta directamente esta discusión.

Fuentes

  • Anthropic · 2023

    WebFetch confirmó la publicación oficial (19 de septiembre de 2023) y los niveles ASL con pruebas adversariales previas al despliegue.

  • Gobierno del Reino Unido (Department for Science, Innovation and Technology) · 2025

    WebFetch confirmó la página oficial de AISI y su rol evaluando capacidades de modelos de frontera (ciberseguridad, persuasión, riesgo a seguridad nacional).

  • NIST (EE. UU.) · 2026

    WebFetch confirmó la página oficial de NIST/CAISI, incluidas evaluaciones fechadas de modelos recientes (julio de 2026) realizadas junto al AISI del Reino Unido.

  • METR (Model Evaluation and Threat Research) · 2026

    WebFetch confirmó la página oficial de METR, su métrica de 'horizonte temporal' de tareas agénticas y su colaboración con OpenAI, Anthropic, Google DeepMind y Meta.

Aparece en los dossiers

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.