Leyes de escalamiento
Relaciones empíricas y predecibles entre el desempeño de un modelo de IA y la cantidad de datos, parámetros y cómputo usados para entrenarlo: a más de esos tres factores, el error baja de forma sistemática, no al azar.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
No es una ley física, sino un patrón estadístico observado repetidas veces: cuando se grafica el error de un modelo contra el tamaño del modelo, la cantidad de datos de entrenamiento o el cómputo usado (en escala logarítmica), la curva resultante es sorprendentemente predecible —una línea recta, lo que en la jerga se llama "ley de potencia". Eso permite anticipar cuánto mejorará un modelo antes de gastar en entrenarlo.
La formulación que popularizó el término es "Scaling Laws for Neural Language Models" (Kaplan et al., 2020, OpenAI), que mostró que el desempeño de modelos de lenguaje mejora de forma predecible al escalar parámetros, datos y cómputo, y que agrandar el modelo rendía más que agrandar proporcionalmente los datos. Dos años después, "Training Compute-Optimal Large Language Models" (Hoffmann et al., 2022, DeepMind), conocido como el paper de Chinchilla, corrigió esa receta: para un presupuesto de cómputo fijo, muchos modelos de la época estaban sobre-parametrizados y sub-entrenados —les convenía ser más chicos y ver muchos más datos—, lo que cambió cómo la industria reparte su presupuesto de entrenamiento.
En términos accesibles: se entrenan versiones pequeñas y baratas de un modelo variando sistemáticamente su tamaño, la cantidad de datos y el cómputo, se mide el error en cada combinación, y se ajusta una curva a esos puntos. Esa curva se extrapola para decidir, antes de gastar millones de dólares en una corrida de entrenamiento gigante, qué combinación de tamaño y datos va a rendir mejor.
Hoy es la base con la que los grandes laboratorios (OpenAI, DeepMind, Anthropic, entre otros) planifican sus modelos insignia: cuánto cómputo destinar, qué tamaño de modelo entrenar y con cuántos datos, antes de comprometer el gasto. También justifica, en parte, la carrera por conseguir más chips y más datos de entrenamiento.
Se discute si estas curvas seguirán rindiendo indefinidamente o si el campo se acerca a un techo, sea por falta de datos de calidad nuevos (el llamado "muro de datos"), por costo energético o económico, o porque el tipo de mejora que entrega más escala —menor error al predecir la siguiente palabra— no equivale automáticamente a mejor razonamiento o menos alucinación. También se discute si "escalar" basta para llegar a sistemas mucho más capaces o si hacen falta cambios de arquitectura o de método de entrenamiento.
¿Por qué te importa?
Buena parte de la inversión multimillonaria en centros de datos, chips y energía para IA se justifica apostando a que estas curvas se sostienen. Entender las leyes de escalamiento te permite leer con más criterio los anuncios de 'el próximo modelo será mucho mejor' y las discusiones sobre si escalar sigue siendo la vía más eficiente.
Ejemplos
- Scaling Laws for Neural Language Models (Kaplan et al., 2020), que estableció las curvas de potencia entre error, tamaño de modelo, datos y cómputo.
- El paper de Chinchilla (Hoffmann et al., 2022), que mostró que modelos más chicos entrenados con más datos podían superar a modelos más grandes entrenados con menos datos, para el mismo presupuesto de cómputo.
- Las decisiones de los grandes laboratorios de IA sobre cuánto cómputo, datos y tamaño de modelo destinar a su siguiente entrenamiento insignia, apoyadas en curvas de este tipo.
Términos relacionados
Debate y controversia
Hay debate activo sobre si las leyes de escalamiento seguirán sosteniéndose —por límites de datos de calidad disponibles, costo energético o económico— y sobre si el tipo de mejora que entrega escalar (menor error al predecir la siguiente palabra) equivale a mejor razonamiento, o si hacen falta ideas nuevas además de más tamaño y más datos.
Fuentes
- Scaling Laws for Neural Language Models Verificada
Jared Kaplan et al. · 2020
WebFetch confirmó título exacto, autores (encabezados por Kaplan, McCandlish, Henighan) y año 2020 en arXiv 2001.08361.
Jordan Hoffmann et al. · 2022
WebFetch confirmó título exacto, autor principal (Jordan Hoffmann) y año 2022 en arXiv 2203.15556 (paper de Chinchilla, DeepMind).