Ir al contenido principal
Volver al Glosario

Cuantización

Reducir la precisión numérica con la que se guardan y calculan los parámetros de un modelo —por ejemplo, de 16 bits a 8 o 4— para que ocupe menos memoria y corra más rápido, a cambio de una pequeña pérdida de calidad.

Última revisión:
Fuentes:
2 fuentes · 2 verificadas

Cada parámetro (peso) de un modelo es, en el fondo, un número guardado con cierta precisión: cuántos bits usa para representarlo. Los modelos suelen entrenarse en precisión de 16 o 32 bits por número. La cuantización redondea esos números a una representación con menos bits —8, 4 o incluso menos— de modo que el mismo modelo, con los mismos parámetros "en esencia", ocupe una fracción de la memoria y se pueda mover y calcular más rápido.

Dettmers et al. (2022) mostraron con LLM.int8() que se podía hacer la multiplicación de matrices de un Transformer en 8 bits para las capas de mayor tamaño, aislando en 16 bits sólo los valores atípicos que sí necesitan mayor precisión, y así correr modelos de 175 mil millones de parámetros con la mitad de la memoria y sin perder desempeño. Dettmers et al. (2023) llevaron la idea más lejos con QLoRA, combinando cuantización a 4 bits con una técnica de ajuste fino eficiente (LoRA), lo que permitió ajustar un modelo de 65 mil millones de parámetros en una sola tarjeta gráfica de consumo de 48 GB, algo antes reservado a infraestructura de centro de datos.

En términos accesibles, es parecido a redondear precios al peso más cercano en vez de guardar cada decimal exacto: si se hace con cuidado, se pierde poco y se ahorra mucho trabajo; si se hace de forma ingenua, la calidad se resiente. Por eso las técnicas modernas de cuantización no redondean todo por igual: identifican qué valores son más sensibles (los "atípicos") y los tratan con más precisión, mientras comprimen agresivamente el resto.

Esto amplió mucho quién puede correr un modelo grande: en vez de necesitar un clúster de servidores, versiones cuantizadas de modelos abiertos —distribuidas en formatos como GGUF— corren en una notebook, un teléfono o una sola tarjeta gráfica de consumo, lo que acerca el uso (y no sólo el consumo por API) de modelos de punta a personas y organizaciones sin infraestructura industrial.

El costo de esa eficiencia es una discusión abierta: cuánta calidad se pierde realmente depende de la tarea, y la pérdida no siempre se nota en los benchmarks estándar pero puede aparecer en tareas de razonamiento fino o en casos límite poco representados en las pruebas. Cuantizaciones muy agresivas (2 bits o menos) degradan de forma mucho más visible que 8 o 4 bits, y sigue siendo tema de investigación activa dónde está el punto justo entre ahorro y calidad para cada tipo de uso.

¿Por qué te importa?

La cuantización es buena parte de la razón por la que hoy podés correr un modelo de IA razonablemente capaz en tu notebook o teléfono, y no sólo a través de la API de una empresa grande. Eso cambia quién puede usar, adaptar e inspeccionar estos modelos.

Ejemplos

  • LLM.int8() (Dettmers et al., 2022), que permitió correr un modelo de 175 mil millones de parámetros con la mitad de la memoria.
  • QLoRA (Dettmers et al., 2023), que combinó cuantización a 4 bits con ajuste fino eficiente en una sola GPU de consumo.
  • Versiones cuantizadas de modelos abiertos (como variantes de Llama o Mistral) distribuidas para correr en notebooks o teléfonos, comunes desde 2023.

Términos relacionados

Debate y controversia

Se discute cuánta calidad se pierde realmente al cuantizar, sobre todo en tareas de razonamiento fino o casos poco representados en los benchmarks usados para justificar cada esquema de cuantización; y cuál es el punto de equilibrio entre ahorro de memoria/velocidad y degradación aceptable para cada tipo de uso.

Fuentes

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.