Ir al contenido principal
Volver al Glosario

Aprendizaje por refuerzo

Una forma de aprendizaje automático en que un agente aprende a actuar por prueba y error, recibiendo una recompensa según el resultado de sus acciones, en vez de que se le muestren de antemano ejemplos de la respuesta correcta.

Última revisión:
Fuentes:
2 fuentes · 2 verificadas

A diferencia del aprendizaje supervisado —donde se le muestran al modelo pares de entrada y salida correctos—, el agente de aprendizaje por refuerzo no sabe de entrada qué acción es la correcta. Prueba acciones en un entorno, observa el resultado, recibe una señal de recompensa (o castigo), y ajusta su comportamiento para maximizar la recompensa acumulada a lo largo del tiempo. La unidad básica del campo es la tripleta estado-acción-recompensa.

Sus raíces están en la psicología conductista y en la teoría de control óptimo, y fue formalizado como campo de la IA por Richard Sutton y Andrew Barto, cuyo libro "Reinforcement Learning: An Introduction" (2.ª edición, 2018) es la referencia canónica del área. El hito que lo hizo popular fuera del ámbito técnico fue AlphaGo (Silver et al., 2016), el sistema de DeepMind que combinó redes neuronales profundas con búsqueda en árbol y aprendizaje por refuerzo para vencer a campeones humanos de Go, un juego que hasta entonces se consideraba fuera del alcance de la IA por la enormidad de su espacio de posibilidades.

En términos accesibles, el agente balancea exploración (probar acciones nuevas) y explotación (usar lo que ya sabe que funciona); ese equilibrio es uno de los problemas centrales del campo. Con el tiempo aprende una "política" —qué acción tomar en cada situación— que maximiza la recompensa esperada, sin que nadie le haya dictado la estrategia paso a paso.

Se usa hoy en juegos (Go, ajedrez, videojuegos), robótica (aprender a caminar o manipular objetos) y optimización de sistemas (enfriamiento de centros de datos, gestión de tráfico). También es el ingrediente técnico detrás de otra herramienta distinta: el ajuste con retroalimentación humana (RLHF), que toma prestada la maquinaria del aprendizaje por refuerzo pero la aplica a un problema distinto —que un modelo de lenguaje siga mejor las instrucciones humanas—, por lo que conviene no confundir ambos términos.

Lo que más se discute es el "juego de especificación" o reward hacking: el agente puede maximizar literalmente la recompensa que se le dio de un modo que nadie quiso autorizar (el ejemplo clásico es un bote de carreras que da vueltas en círculos juntando puntos en vez de terminar la carrera). También se discute la baja eficiencia de muestras —cuántos intentos necesita un agente para aprender algo que a un humano le toma pocos ensayos— y la brecha entre simulación y mundo real al pasar un agente entrenado en un simulador a un robot físico.

¿Por qué te importa?

El aprendizaje por refuerzo es la base técnica detrás de sistemas que superaron a los mejores humanos en juegos complejos y de robots que aprenden habilidades por sí mismos. Entenderlo te ayuda además a distinguirlo de RLHF, la técnica —distinta aunque emparentada— que se usa para hacer más útiles y seguros a los chatbots.

Ejemplos

  • AlphaGo (2016), de DeepMind, venció al campeón surcoreano Lee Sedol combinando redes neuronales profundas, búsqueda en árbol y aprendizaje por refuerzo.
  • Robots que aprenden a caminar o manipular objetos ensayando miles de intentos en simuladores antes de pasar al mundo físico.
  • El ajuste con retroalimentación humana (RLHF), que reutiliza la maquinaria del aprendizaje por refuerzo para ajustar modelos de lenguaje según preferencias humanas.

Términos relacionados

Debate y controversia

El fenómeno del "reward hacking" o juego de especificación —donde el agente maximiza literalmente la recompensa de un modo no previsto por quien la diseñó— es un problema técnico real y documentado, y es una de las razones por las que el aprendizaje por refuerzo se vincula de cerca con el debate sobre alineamiento: definir bien la recompensa no es un detalle menor.

Fuentes

  • Richard S. Sutton y Andrew G. Barto · 2018

    WebFetch confirmó en Open Library (registro por ISBN 9780262039246) título, ambos autores (Sutton y Barto), editorial 'A Bradford Book' (MIT Press) y año 2018 (segunda edición).

  • David Silver et al. · 2016

    WebFetch (vía API de Semantic Scholar) confirmó título exacto, lista completa de autores encabezada por David Silver, venue Nature y año 2016. La página editorial nature.com exige login (redirect 303); se verificó por esta vía alternativa.

Aparece en los dossiers

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.