Ir al contenido principal
Volver al Glosario

Alineamiento

El problema de lograr que un sistema de IA persiga lo que realmente queremos que persiga, y no una versión literal, parcial o peligrosa de eso.

Última revisión:
Fuentes:
2 fuentes · 2 verificadas

Decirle a una IA qué hacer parece fácil; que entienda exactamente qué querías decir es otra cosa. El alineamiento es el campo que estudia cómo hacer que los objetivos del modelo coincidan con las intenciones y los valores de quien lo usa y de la sociedad, incluyendo los casos en que el modelo es mucho más capaz que la persona que lo supervisa.

No es lo mismo que seguridad ni que control, aunque se relacionan. Seguridad es el paraguas amplio de prevenir daños (incluido el mal uso humano); control es la capacidad operativa de contener, corregir o frenar un sistema. El alineamiento es una pieza de ambos: un modelo perfectamente controlado puede estar mal alineado, y un modelo bien alineado puede seguir siendo difícil de controlar si sus capacidades crecen más rápido que la supervisión.

El problema es duro porque los valores son vagos, cambiantes y objeto de desacuerdo (¿los de quién?), y porque un modelo puede aprender a parecer alineado sin estarlo. Por eso organismos como NIST lo tratan como una práctica continua —gobernar, mapear, medir, gestionar el riesgo— más que como una casilla que se marca una vez.

A medida que los modelos crecieron, alinearlos "a mano" —con personas etiquetando cada respuesta buena o mala— se volvió menos escalable: hay más respuestas que evaluar de las que un equipo humano puede revisar con cuidado. Constitutional AI (Bai et al., 2022) propuso una alternativa: en vez de depender sólo de etiquetas humanas, el modelo aprende a criticar y revisar sus propias respuestas según un conjunto de principios escritos —una "constitución"—, y luego se entrena con retroalimentación generada por otro modelo (RL a partir de retroalimentación de IA, o RLAIF) en vez de exclusivamente por personas. No reemplaza el juicio humano —los principios los sigue escribiendo alguien—, pero traslada parte del trabajo repetitivo de evaluar cada respuesta hacia el propio sistema.

Eso abre una pregunta más incómoda: si un modelo llega a ser más capaz que la persona que lo supervisa en un dominio dado, ¿cómo se verifica que su respuesta es correcta y no sólo convincente? Ese problema —a veces llamado "supervisión escalable"— es distinto de alinear un modelo actual con instrucciones simples, y es una de las razones por las que el alineamiento se trata como práctica continua y no como una certificación única.

El problema de fondo sigue siendo el mismo: los valores son vagos, cambiantes y objeto de desacuerdo, y un modelo puede aprender a parecer alineado en la evaluación sin estarlo fuera de ella. Ninguna técnica —ni RLHF, ni Constitutional AI, ni la supervisión escalable— cierra esa brecha por completo; la reducen, con distinto costo y distinto grado de dependencia del juicio humano.

¿Por qué te importa?

Si la IA actúa por nosotros cada vez más, que persiga el objetivo correcto no es un detalle técnico: es la diferencia entre una herramienta útil y un sistema que hace exactamente lo que le pediste, pero de un modo que nadie quería.

Ejemplos

  • El ajuste con retroalimentación humana (RLHF), usado desde InstructGPT (2022) para que los modelos sigan instrucciones de forma más útil y segura.
  • Los marcos voluntarios de gestión de riesgo de IA, como el NIST AI RMF (2023).
  • La disciplina de investigación académica sobre seguridad de IA, sintetizada para público general en The Alignment Problem (Christian, 2020).
  • Constitutional AI (Bai et al., 2022), que entrena a un modelo para autocorregirse según principios escritos, con retroalimentación generada por otro modelo en vez de sólo por humanos.

Términos relacionados

Debate y controversia

Hay debate real sobre si el alineamiento es "resoluble" en general o sólo caso por caso, sobre los valores de quién se priorizan cuando no hay consenso, y sobre el llamado "impuesto de alineamiento" (cuánto rendimiento cuesta alinear). También se discute si el ritmo de avance de las capacidades supera al de la investigación en seguridad.

Fuentes

  • NIST (EE. UU.) · 2023

    WebFetch confirmó la página oficial de NIST, marco AI RMF 1.0 publicado enero 2023; cubre confiabilidad, transparencia y trazabilidad.

  • Brian Christian · 2020

    WebFetch confirmó en Open Library autor (Brian Christian), título y subtítulo; editorial W. W. Norton. El registro OL consultado es la edición en rústica de 2021; la primera edición de tapa dura es de 2020.

Aparece en los dossiers