RLHF (aprendizaje por refuerzo con retroalimentación humana)
Una técnica de ajuste que usa comparaciones y preferencias de personas —en vez de una función de recompensa programada a mano— para enseñarle a un modelo qué respuestas prefiere la gente, y guiarlo hacia esas respuestas con aprendizaje por refuerzo.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
Un modelo recién preentrenado sabe predecir texto plausible, pero "plausible" no es lo mismo que "útil", "seguro" o "lo que la persona realmente quería". RLHF (Reinforcement Learning from Human Feedback) cierra esa brecha usando retroalimentación humana como señal de entrenamiento: en vez de programar una regla explícita de qué está bien, se les muestran a evaluadores humanos varias respuestas posibles y ellos indican cuál prefieren; esa preferencia entrena un modelo de recompensa que después guía el ajuste del modelo principal.
La idea de aprender de preferencias humanas en vez de una recompensa programada viene de Christiano et al. (2017), que mostraron que un agente de aprendizaje por refuerzo podía aprender tareas de control complejas a partir de comparaciones humanas entre pares de segmentos de comportamiento, usando retroalimentación sobre menos del uno por ciento de las interacciones del agente. La aplicación que la volvió masiva en modelos de lenguaje fue InstructGPT (Ouyang et al., 2022): OpenAI ajustó GPT-3 recolectando rankings humanos de respuestas y usando esos rankings para entrenar un modelo de recompensa, que después guio el ajuste del modelo de lenguaje con un algoritmo de aprendizaje por refuerzo.
En términos accesibles, el proceso tiene tres pasos habituales. Primero, un ajuste supervisado inicial con ejemplos de buenas respuestas escritas por personas. Segundo, se generan varias respuestas a un mismo mensaje y evaluadores humanos las ordenan de mejor a peor; con esos rankings se entrena un modelo de recompensa que aprende a "puntuar" respuestas de forma parecida a como lo haría una persona. Tercero, el modelo de lenguaje se ajusta con aprendizaje por refuerzo para producir más respuestas de las que ese modelo de recompensa calificaría bien.
Hoy es parte estándar del proceso detrás de casi todos los asistentes conversacionales comerciales: es lo que explica, en gran medida, la diferencia entre un modelo recién preentrenado (que completa texto de forma plausible pero desordenada) y un asistente que sigue instrucciones, mantiene un tono consistente y evita ciertas respuestas.
Conviene no confundir RLHF con "alineamiento" en general: RLHF es una técnica concreta, una de varias herramientas hacia ese objetivo más amplio, no una solución completa (ver alineamiento). Se discute el llamado "impuesto de alineamiento" —RLHF puede mejorar la utilidad percibida pero a veces reduce diversidad de respuestas o rinde peor en ciertas métricas—, el sesgo de los propios evaluadores humanos que entrenan el modelo de recompensa (sus preferencias no siempre reflejan lo más correcto o lo más seguro), y variantes más recientes que buscan lograr un efecto similar con menos costo humano, como el uso de retroalimentación generada por otra IA o técnicas que optimizan preferencias sin entrenar un modelo de recompensa separado.
¿Por qué te importa?
El mismo modelo base, antes y después de este proceso, se comporta de forma muy distinta: RLHF explica buena parte de por qué un asistente conversacional 'suena' útil, cortés y dispuesto a seguir instrucciones, en vez de sólo completar texto de la manera más probable.
Ejemplos
- InstructGPT (2022), el primer despliegue masivo de RLHF sobre GPT-3, base técnica del ChatGPT original lanzado ese mismo año.
- El trabajo original de Christiano et al. (2017) sobre aprender de preferencias humanas en tareas de control con aprendizaje por refuerzo.
- Variantes posteriores, como la optimización directa de preferencias (DPO, 2023), que buscan un efecto similar sin entrenar un modelo de recompensa separado.
Términos relacionados
Debate y controversia
Se discute el 'impuesto de alineamiento' (posible pérdida de diversidad o de desempeño en algunas métricas a cambio de mayor utilidad percibida), el sesgo de los evaluadores humanos cuyas preferencias entrenan el modelo de recompensa, y si RLHF realmente 'alinea' al modelo con valores humanos o sólo lo ajusta a lo que un grupo particular de evaluadores prefiere en la práctica.
Fuentes
Paul Christiano et al. · 2017
WebFetch confirmó título y autores (Christiano, Leike, Brown, Martic, Legg, Amodei) en arXiv 1706.03741, 2017; establece el marco de aprender de preferencias humanas en RL.
Long Ouyang et al. · 2022
WebFetch confirmó título y autores (Ouyang et al.) en arXiv 2203.02155, 2022; es el paper de InstructGPT que aplica RLHF a un modelo de lenguaje a escala.