Aprendizaje profundo (deep learning)
Una familia de técnicas de aprendizaje automático basada en redes neuronales de muchas capas, que aprende directamente de los datos las características relevantes para una tarea en lugar de que un humano las defina a mano. Es el paradigma que hizo posible la ola actual de IA.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
Una red neuronal profunda está organizada en capas apiladas, donde cada capa transforma la representación que recibe de la anterior. "Profundo" se refiere al número de capas, no a que la red "piense hondo". La diferencia con el aprendizaje automático clásico es de fondo: antes, un ingeniero diseñaba a mano las características relevantes (para reconocer un gato, programaba detectores de bordes y texturas); en deep learning, la red aprende esas características por sí sola a partir de ejemplos.
Aunque las redes neuronales y el backpropagation existen desde los años 80, el quiebre práctico llegó con AlexNet (Krizhevsky, Sutskever y Hinton, 2012), que ganó por amplio margen la competencia de reconocimiento de imágenes ImageNet usando una red convolucional profunda entrenada en GPUs. Ese resultado convenció a buena parte del campo de que más capas, más datos y más cómputo superaban a los enfoques diseñados a mano. Yann LeCun, Yoshua Bengio y Geoffrey Hinton sistematizaron el paradigma en su artículo de revisión "Deep learning" (Nature, 2015).
En términos accesibles, el entrenamiento ajusta millones o miles de millones de parámetros mediante descenso de gradiente y backpropagation, a partir de ejemplos (etiquetados o no). Las capas tempranas de la red capturan patrones simples —bordes, sonidos básicos—; las capas más profundas combinan esos patrones en conceptos más abstractos —rostros, palabras, ideas.
Hoy el deep learning está detrás de la visión computacional (reconocimiento facial, autos autónomos), el reconocimiento y síntesis de voz, la traducción automática y, sobre todo, los modelos de lenguaje grandes actuales, cuya arquitectura transformer es también una red profunda. Casi todo lo que hoy se llama "IA" en productos comerciales corre sobre este paradigma.
Lo que se discute no es si funciona, sino sus costos y sus límites: el gasto computacional y energético de entrenar redes cada vez más grandes, la falta de interpretabilidad (es difícil saber por qué una red tomó una decisión particular, el problema de la "caja negra"), y si seguir agrandando redes sigue siendo la vía más eficiente de progreso o si el campo necesita ideas arquitectónicas nuevas en vez de sólo escala.
¿Por qué te importa?
Casi toda la IA que usas a diario —desde el reconocimiento facial de tu teléfono hasta el chat que te responde— corre sobre deep learning. Entender el paradigma te ayuda a distinguir un avance real de una arquitectura nueva de una simple mejora de escala, y a entender por qué entrenar estos sistemas es tan caro.
Ejemplos
- AlexNet (2012), la red convolucional profunda que redujo drásticamente la tasa de error en la competencia ImageNet respecto de los métodos anteriores y disparó el interés comercial en deep learning.
- Los modelos de traducción y reconocimiento de voz que usan a diario servicios como Google Translate o los asistentes de voz.
- La arquitectura transformer, una red profunda, detrás de los modelos de lenguaje actuales como GPT o Claude.
Términos relacionados
Debate y controversia
Se discute si seguir agrandando redes (más capas, parámetros y datos) sigue rindiendo frutos proporcionales o si el campo enfrenta rendimientos decrecientes que exigen ideas arquitectónicas distintas a la escala. También hay debate sobre la falta de interpretabilidad de estas redes —son efectivas, pero difíciles de auditar— y sobre el costo energético de entrenarlas.
Fuentes
- Deep learning Verificada
Yann LeCun, Yoshua Bengio y Geoffrey Hinton · 2015
Verificado vía metadatos de Crossref (DOI 10.1038/nature14539): título 'Deep learning', autores LeCun, Bengio y Hinton, Nature vol. 521, 2015. La página editorial nature.com exige login (redirect 303); se usó el DOI como fuente autoritativa.
Alex Krizhevsky, Ilya Sutskever y Geoffrey E. Hinton · 2012
WebFetch confirmó título exacto, autores (Krizhevsky, Sutskever, Hinton) y año 2012 en la página oficial de NeurIPS Proceedings (AlexNet).