Contexto (ventana de contexto)
La cantidad de texto (o de tokens) que un modelo puede tener presente a la vez para producir una respuesta. Es su memoria de trabajo inmediata.
- Última revisión:
- Fuentes:
- 4 fuentes · 4 verificadas
Todo modelo tiene un límite de cuánto puede "mirar" al mismo tiempo: el contexto. Si le pasas un documento enorme, sólo entra lo que cabe en esa ventana. Lo que queda fuera, el modelo no lo considera, por más relevante que sea.
Los números han crecido rápido. Gemini 1.5 Pro (Google, febrero de 2024) salió con una ventana estándar de 128.000 tokens y ofreció, en vista previa limitada, hasta 1 millón de tokens —suficiente, según el propio anuncio, para procesar una hora de video, once horas de audio o un código base de más de 30.000 líneas en una sola pasada—. Año y medio después, Claude Sonnet 4 (Anthropic, agosto de 2025) llevó su ventana de contexto a 1 millón de tokens en la API, pensada para mantener coherencia a lo largo de cientos de llamadas a herramientas dentro de un mismo agente. La tendencia de crecimiento es real, pero el tamaño de la ventana no es todo el problema, como muestra el siguiente hallazgo.
Una ventana mayor suena siempre mejor, pero no garantiza que el modelo la use bien. El estudio "Lost in the Middle" (Liu et al., 2023) mostró que los modelos aprovechan bien lo que está al principio y al final del contexto, pero degradan en el medio: tener más lugar no equivale a prestar más atención. Esa brecha entre capacidad y uso efectivo es justamente lo que motiva técnicas como RAG, que traen sólo la información necesaria en vez de meterlo todo de golpe.
El contexto es también un cuello de botella económico: procesar más tokens cuesta más cómputo y más dinero. Por eso la longitud del contexto es a la vez una capacidad técnica (cuánto cabe), un comportamiento (cuánto se usa bien) y un costo.
Por eso la industria evalúa esto con pruebas que esconden un dato puntual en distintas posiciones de un texto larguísimo —informalmente llamadas pruebas de "aguja en el pajar"— para comprobar si el modelo lo encuentra sin importar dónde quedó, y no sólo cuando está al principio o al final. Que un modelo pase esa prueba en laboratorio tampoco garantiza que rinda igual frente al desorden y la redundancia de documentos reales, que rara vez están tan limpios como el material de una evaluación.
¿Por qué te importa?
Cuando un asistente 'olvida' algo que le diste antes, o se equivoca en un documento largo, casi siempre es un asunto de contexto. Saber que la memoria del modelo es limitada y desigual te ayuda a organizar mejor lo que le pasas.
Ejemplos
- Modelos con ventanas que pasaron de miles a cientos de miles —o un millón— de tokens en pocos años.
- El hallazgo de Liu et al. (2023): los modelos rinden peor en la parte media de un contexto largo.
- El uso de RAG para entregar sólo el pasaje relevante en vez de todo un repositorio.
- Claude Sonnet 4 (Anthropic, agosto de 2025), que llevó su ventana de contexto a 1 millón de tokens en la API.
Términos relacionados
Debate y controversia
Se discute si ampliar la ventana de contexto reduce o no la necesidad de RAG (para muchos casos no la elimina), y cómo medir de forma justa si un modelo realmente "usa" bien un contexto extenso en vez de inflar métricas de laboratorio.
Fuentes
Nelson F. Liu et al. · 2023
WebFetch confirmó título exacto y autores (Liu et al.) en arXiv 2307.03172, año 2023.
- Attention Is All You Need Verificada
Ashish Vaswani et al. · 2017
WebFetch confirmó título y autores (Vaswani et al.) en arXiv 1706.03762, 2017 (arquitectura Transformer, base del procesamiento del contexto).
- Our next-generation model: Gemini 1.5 Verificada
Google · 2024
WebFetch confirmó el anuncio oficial de Google, 15 de febrero de 2024: ventana estándar de 128.000 tokens y vista previa limitada de hasta 1 millón de tokens para Gemini 1.5 Pro.
- 1M token context window Verificada
Anthropic · 2025
WebFetch confirmó el anuncio oficial de Anthropic (12 de agosto de 2025, servido también en claude.com/blog/1m-context tras redirección), que lleva la ventana de contexto de Claude Sonnet 4 a 1 millón de tokens en la API.