Destilación de modelos
Entrenar un modelo más chico —el 'estudiante'— para imitar el comportamiento de un modelo grande ya entrenado —el 'profesor'—, de forma que conserve buena parte de su desempeño con muchos menos parámetros y menor costo de uso.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
La idea nace fuera de los modelos de lenguaje actuales. Hinton, Vinyals y Dean (2015) mostraron que se podía comprimir el conocimiento de un modelo grande (o de un conjunto de modelos, un "ensemble") en un modelo mucho más chico, entrenando a este último no sólo para acertar la respuesta correcta, sino para imitar las probabilidades completas que el modelo grande le asigna a cada opción posible —una señal más rica que una simple etiqueta de correcto o incorrecto, a veces llamada "conocimiento oscuro".
En términos accesibles: en vez de entrenar al modelo chico sólo con las respuestas "correctas" de un conjunto de datos etiquetado por humanos, se le entrena para reproducir las salidas del modelo grande frente a las mismas entradas, incluyendo qué tan seguro estaba el profesor de cada alternativa. Esa información adicional le permite al estudiante aprender matices que sólo con ejemplos etiquetados sería difícil captar con tan pocos parámetros.
DistilBERT (Sanh et al., 2019) aplicó la técnica a un modelo de lenguaje a escala: logró conservar cerca del 97% del desempeño de BERT en tareas de comprensión de lenguaje con un modelo 40% más chico y 60% más rápido, mostrando que la destilación funcionaba también sobre modelos de lenguaje grandes, no sólo sobre clasificadores pequeños como en el trabajo original de 2015.
Hoy es una técnica estándar de la industria para llevar un modelo grande y caro a producto: las versiones "mini", "flash" o "lite" que ofrecen los grandes laboratorios junto a su modelo insignia suelen apoyarse, entre otras técnicas, en destilación para entregar buena parte de la capacidad del modelo grande a una fracción del costo y la latencia, algo útil para aplicaciones móviles, en tiempo real o de alto volumen.
La destilación hereda las limitaciones y sesgos del modelo profesor: un estudiante no puede superar aquello que se le enseñó a imitar, y suele perder capacidad justo en tareas poco comunes o casos límite que el profesor no mostró con suficiente claridad durante el entrenamiento. También se discute cuánta de la capacidad funcional del profesor se transmite de verdad frente a cuánta es sólo mímica superficial de patrones de salida en las tareas donde se evaluó la destilación.
¿Por qué te importa?
Explica por qué versiones más baratas y rápidas de un modelo de IA pueden seguir sintiéndose bastante capaces: buena parte del tiempo, es un modelo grande 'enseñándole' a uno chico, en vez de un modelo chico entrenado desde cero con menos datos.
Ejemplos
- El trabajo que formalizó la destilación de conocimiento (Hinton, Vinyals y Dean, 2015).
- DistilBERT (2019), versión destilada de BERT ampliamente usada en producción.
- Las versiones 'mini' o más livianas de modelos de lenguaje grandes comerciales, ofrecidas junto al modelo insignia desde alrededor de 2023-2024 para casos de uso de menor costo.
Términos relacionados
Debate y controversia
Se discute cuánta capacidad y matices del modelo profesor realmente se transmiten al estudiante frente a cuánta es mímica superficial limitada a las tareas donde se evaluó la destilación, y el hecho de que un modelo destilado hereda —sin poder corregirlos por sí mismo— los sesgos y errores sistemáticos del modelo del que aprendió.
Fuentes
- Distilling the Knowledge in a Neural Network Verificada
Geoffrey Hinton, Oriol Vinyals, Jeff Dean · 2015
WebFetch confirmó título y autores en arXiv 1503.02531 (2015; presentado en el NIPS 2014 Deep Learning Workshop); formaliza la destilación de conocimiento.
Victor Sanh, Lysandre Debut, Julien Chaumond, Thomas Wolf · 2019
WebFetch confirmó título y autores en arXiv 1910.01108, 2019; reporta 97% del desempeño de BERT con 40% menos tamaño y 60% más velocidad.