Ir al contenido principal
Volver al Glosario

Transformer y mecanismo de atención

La arquitectura de red neuronal que hoy sostiene a casi todos los modelos de lenguaje grandes, construida alrededor de un mecanismo —la atención— que le permite a cada palabra de un texto 'mirar' directamente a cualquier otra palabra relevante, sin importar cuán lejos esté.

Última revisión:
Fuentes:
2 fuentes · 2 verificadas

Antes de 2017, el enfoque dominante en procesamiento de lenguaje eran redes recurrentes (RNN, LSTM), que leían palabra por palabra en orden y arrastraban un estado interno que se iba degradando cuanto más lejana era la dependencia entre dos palabras. El mecanismo de atención nació antes que el Transformer: Bahdanau, Cho y Bengio (2014/2015) lo propusieron para traducción automática, permitiendo que el modelo, al traducir una palabra, "buscara" y ponderara qué palabras de la oración original eran relevantes en vez de comprimir toda la oración en un único vector fijo.

El salto que cambió el campo fue "Attention Is All You Need" (Vaswani et al., 2017): eliminaron por completo la recurrencia y construyeron una arquitectura —el Transformer— basada únicamente en atención. Su pieza central es la autoatención (self-attention): cada elemento de la secuencia se compara con todos los demás elementos de esa misma secuencia y calcula cuánto "peso" darle a cada uno para construir su propia representación. Al repetir esto en paralelo con varias "cabezas" de atención, el modelo captura a la vez distintos tipos de relación —sintáctica, temática, de referencia— sin procesar la secuencia en orden estricto.

En términos accesibles: cada palabra se traduce a tres vectores —consulta, llave y valor—, y el peso de atención entre dos palabras sale de comparar la consulta de una con la llave de la otra; ese peso decide cuánto del valor de la segunda entra en la representación final de la primera. Como no hay recurrencia, todas las posiciones se procesan al mismo tiempo (mucho más rápido de entrenar en hardware paralelo como GPUs), pero al perder el orden secuencial explícito el Transformer necesita agregar una "codificación posicional" para saber qué palabra vino antes de cuál.

Hoy el Transformer (y variantes de su mecanismo de atención) es la base de prácticamente todos los modelos de lenguaje grandes en uso —GPT, BERT, Claude, Gemini, Llama— y también de modelos de visión (como el Vision Transformer, que aplicó la misma idea a imágenes en vez de texto) y de sistemas multimodales. Casi cualquier avance reciente en IA generativa corre, en el fondo, sobre esta misma arquitectura con ajustes de escala e ingeniería.

Se discute, primero, un límite técnico real: el costo de la autoatención crece de forma cuadrática con el largo de la secuencia (cada token se compara con todos los demás), lo que impulsó años de investigación en variantes más baratas para contextos largos. Segundo, hay debate de interpretabilidad: algunos estudios han cuestionado si los pesos de atención son una buena "explicación" de por qué el modelo llegó a una respuesta, mientras otros matizan esa crítica; conviene no confundir "el modelo le dio peso a esta palabra" con "el modelo entendió esto por esta razón", que es una lectura mucho más fuerte y no demostrada.

¿Por qué te importa?

Entender de dónde sale la capacidad de estos modelos explica por qué son tan buenos generalizando patrones de lenguaje, por qué entrenarlos y correrlos es tan caro en cómputo, y por qué darle 'más contexto' a un modelo no es gratis: el costo crece más rápido que el largo del texto.

Ejemplos

  • GPT-3 (2020) y los modelos de lenguaje grandes posteriores, construidos enteramente sobre la arquitectura Transformer.
  • BERT (2018), que usa la mitad 'codificadora' del Transformer para tareas de comprensión de lenguaje.
  • El Vision Transformer (2020), que llevó el mismo mecanismo de atención de texto a imágenes.

Términos relacionados

Debate y controversia

El debate técnico real es doble: el costo cuadrático de la autoatención frente al largo del texto (que motiva investigación constante en variantes más eficientes) y si los pesos de atención pueden leerse como una explicación fiable de las decisiones del modelo, algo que parte de la literatura de interpretabilidad ha puesto en duda.

Fuentes

  • Ashish Vaswani et al. · 2017

    WebFetch confirmó título y autores (Vaswani et al.) en arXiv 1706.03762, 2017; el paper que introduce el Transformer basado únicamente en atención.

  • Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · 2014

    WebFetch confirmó título y autores en arXiv 1409.0473 (2014, aceptado en ICLR 2015); introduce el mecanismo de atención (alineación suave) previo al Transformer.

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.