Ir al contenido principal
Volver al Glosario

Multimodalidad

La capacidad de un modelo de IA de procesar y combinar más de un tipo de dato a la vez —texto, imagen, audio, video— en vez de estar limitado a uno solo.

Última revisión:
Fuentes:
2 fuentes · 2 verificadas

Un modelo "unimodal" sólo entiende un tipo de entrada: sólo texto, o sólo imagen. Un modelo multimodal puede recibir —y a veces producir— combinaciones: una foto y una pregunta sobre ella, un audio y su transcripción, un video y un resumen de lo que ocurre en él. La dificultad de fondo es que cada tipo de dato tiene una estructura distinta (el texto es secuencial y discreto, una imagen es una grilla de píxeles continua), y el modelo necesita una forma común de representarlos para poder relacionarlos entre sí.

CLIP (Radford et al., 2021) fue un salto importante en esa dirección: entrenado sobre 400 millones de pares imagen-texto tomados de internet, aprendió a ubicar en el mismo espacio de embeddings una imagen y su descripción en palabras, de modo que "una foto de un perro" y la palabra "perro" quedan cerca en ese espacio compartido. Esa idea —proyectar distintas modalidades a un mismo espacio numérico comparable— es la base técnica de buena parte de la multimodalidad actual.

En términos accesibles: en vez de un modelo separado para cada tipo de dato, se usa un "codificador" distinto para cada modalidad (uno para texto, otro para imagen, otro para audio) que traduce esa entrada a vectores comparables entre sí, y luego un modelo compartido —normalmente basado en la arquitectura Transformer— razona sobre esa representación común, sin que le importe de qué modalidad vino cada parte.

Los modelos insignia actuales de los grandes laboratorios —como la familia Gemini de Google (2023), presentada explícitamente como "multimodal desde el diseño", o versiones con visión de GPT y Claude— reciben texto e imágenes (y cada vez más audio y video) en la misma conversación. Se usa a diario en asistentes que describen una foto, leen un documento escaneado, transcriben una reunión o generan una imagen a partir de una descripción en palabras.

Un modelo multimodal no necesariamente integra todas las modalidades por igual: puede ser mucho más capaz en texto que en imagen, o fallar en tareas donde de verdad hace falta relacionar con precisión lo visual y lo textual, como contar objetos en una foto o leer un gráfico complejo. Evaluar qué tan bien un modelo integra —en vez de sólo "aceptar"— varias modalidades a la vez sigue siendo un área de investigación activa, sin una métrica única aceptada por toda la comunidad.

¿Por qué te importa?

Explica por qué hoy podés subir una foto o un PDF y hacerle preguntas, o dictar un audio para que te lo resuma, en vez de estar limitado a escribir texto plano. Cambia directamente qué tareas cotidianas puede ayudarte a resolver un asistente de IA.

Ejemplos

  • CLIP (2021), que conectó imágenes y texto en un mismo espacio de representación.
  • Gemini (Google, 2023), presentado explícitamente como una familia de modelos multimodal desde su diseño.
  • Asistentes de uso diario que entre 2024 y 2025 incorporaron entrada de voz, imagen y documentos dentro de la misma conversación.

Términos relacionados

Debate y controversia

Se discute que la integración entre modalidades suele ser despareja (mejor en texto que en imagen, por ejemplo) y que no existe todavía una métrica de evaluación única y aceptada para medir qué tan bien un modelo realmente relaciona —en vez de sólo aceptar por separado— distintos tipos de dato a la vez.

Fuentes

Aparece en los dossiers

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.