Inferencia
La fase en que un modelo ya entrenado produce una respuesta a partir de una entrada. Es el 'usar' el modelo, por contraposición al 'entrenarlo'.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
La vida de un modelo tiene dos fases muy distintas. El entrenamiento es costoso y largo: el modelo aprende a partir de enormes cantidades de datos. La inferencia es lo que ocurre cada vez que alguien lo usa: toma una entrada y genera una salida, sin cambiar lo que aprendió.
Esa distinción explica gran parte de la economía de la IA. Entrenar un modelo grande se hace una vez (o pocas veces) y consume muchísimo cómputo; inferir se hace millones de veces al día, y el costo y la energía de cada una suman. Por eso optimizar la inferencia —hacerla más rápida, más barata, o capaz de 'pensar más' sin reentrenar— es un área activa: el trabajo de Snell et al. (2024) sobre escalar el cómputo en inferencia mostró que, a veces, darle más 'tiempo de pensar' a un modelo pequeño rinde más que agrandarlo.
Entender 'inferencia' ayuda a leer dos discursos habituales. Primero, que un modelo no 'aprende' de lo que le dices en una conversación común: responde usando lo que ya sabe (inferencia), salvo que se lo reentrene o se usen técnicas especiales. Segundo, que el desempeño en uso real depende tanto de cómo se ejecute la inferencia como del modelo mismo.
Hay todo un conjunto de técnicas de ingeniería, distintas del propio modelo, dedicadas exclusivamente a abaratar esa fase: reducir la precisión numérica con la que se representan los cálculos (cuantización), agrupar varias solicitudes de distintos usuarios para procesarlas juntas (batching), o reutilizar el cómputo de una parte del prompt que ya se procesó antes en vez de rehacerlo (caché de contexto). Ninguna de ellas cambia lo que el modelo "sabe": sólo cambian cuánto cuesta y cuánto demora obtener la misma respuesta.
El costo y la velocidad de la IA que usas a diario vienen, entonces, tanto del tamaño del modelo como de qué tan bien optimizada está su inferencia. Dos proveedores pueden ofrecer un modelo de capacidad similar y cobrar o demorar de forma muy distinta, y esa diferencia rara vez está en el modelo mismo, sino en la ingeniería —normalmente invisible para quien lo usa— que corre por debajo.
¿Por qué te importa?
El costo y la velocidad de la IA que usas a diario vienen de la inferencia, no del entrenamiento. Por eso una respuesta tarda lo que tarda y cuesta lo que cuesta, y por eso la industria se obsesiona con hacerla más eficiente.
Ejemplos
- Cada respuesta que genera un chatbot en tu pantalla es una inferencia.
- El escalamiento del cómputo en inferencia (Snell et al., 2024): pensar más en tiempo de uso en vez de agrandar el modelo.
- El esfuerzo de la industria por comprimir y acelerar modelos para que corran en servidores y dispositivos más baratos.
Términos relacionados
Debate y controversia
No hay una 'polémica' fuerte sobre el término mismo, pero sí sobre sus consecuencias: cuánta energía y agua consume la inferencia a escala, y si la tendencia a invertir más cómputo en tiempo de inferencia es sostenible o un callejón costoso. En el sentido filosófico, que un modelo 'infiera' no implica que comprenda: el término es técnico (producir una salida), no una afirmación sobre entendimiento.
Fuentes
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters Verificada
Charlie Snell et al. · 2024
WebFetch confirmó título y autores (Snell et al.) en arXiv 2408.03314, 2024; trata de escalar cómputo en inferencia/tiempo de prueba.
Rishi Bommasani et al. · 2021
WebFetch confirmó (arXiv 2108.07258, 2021). Se cita porque distingue la fase de adaptación/uso posterior al entrenamiento, donde vive la inferencia.