Alineamiento
El problema de lograr que un sistema de IA persiga lo que realmente queremos que persiga, y no una versión literal, parcial o peligrosa de eso.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
Decirle a una IA qué hacer parece fácil; que entienda exactamente qué querías decir es otra cosa. El alineamiento es el campo que estudia cómo hacer que los objetivos del modelo coincidan con las intenciones y los valores de quien lo usa y de la sociedad, incluyendo los casos en que el modelo es mucho más capaz que la persona que lo supervisa.
No es lo mismo que seguridad ni que control, aunque se relacionan. Seguridad es el paraguas amplio de prevenir daños (incluido el mal uso humano); control es la capacidad operativa de contener, corregir o frenar un sistema. El alineamiento es una pieza de ambos: un modelo perfectamente controlado puede estar mal alineado, y un modelo bien alineado puede seguir siendo difícil de controlar si sus capacidades crecen más rápido que la supervisión.
El problema es duro porque los valores son vagos, cambiantes y objeto de desacuerdo (¿los de quién?), y porque un modelo puede aprender a parecer alineado sin estarlo. Por eso organismos como NIST lo tratan como una práctica continua —gobernar, mapear, medir, gestionar el riesgo— más que como una casilla que se marca una vez.
¿Por qué te importa?
Si la IA actúa por nosotros cada vez más, que persiga el objetivo correcto no es un detalle técnico: es la diferencia entre una herramienta útil y un sistema que hace exactamente lo que le pediste, pero de un modo que nadie quería.
Ejemplos
- El ajuste con retroalimentación humana (RLHF), usado desde InstructGPT (2022) para que los modelos sigan instrucciones de forma más útil y segura.
- Los marcos voluntarios de gestión de riesgo de IA, como el NIST AI RMF (2023).
- La disciplina de investigación académica sobre seguridad de IA, sintetizada para público general en The Alignment Problem (Christian, 2020).
Términos relacionados
Debate y controversia
Hay debate real sobre si el alineamiento es "resoluble" en general o sólo caso por caso, sobre los valores de quién se priorizan cuando no hay consenso, y sobre el llamado "impuesto de alineamiento" (cuánto rendimiento cuesta alinear). También se discute si el ritmo de avance de las capacidades supera al de la investigación en seguridad.
Fuentes
NIST (EE. UU.) · 2023
WebFetch confirmó la página oficial de NIST, marco AI RMF 1.0 publicado enero 2023; cubre confiabilidad, transparencia y trazabilidad.
Brian Christian · 2020
WebFetch confirmó en Open Library autor (Brian Christian), título y subtítulo; editorial W. W. Norton. El registro OL consultado es la edición en rústica de 2021; la primera edición de tapa dura es de 2020.