Ir al contenido principal
Volver a la línea de tiempo
Estados Unidos
Documentado

CLIP y DALL·E abren la IA multimodal texto-imagen

En enero de 2021 OpenAI presentó a la vez DALL·E (generación de imágenes desde texto) y CLIP (aprendizaje conjunto de texto e imagen que clasifica visuales con instrucciones en lenguaje natural). Juntos demostraron que un mismo modelo podía tender un puente estable entre el lenguaje y la visión, algo hasta entonces esquivo.

Por qué es un hito

Arrancaron la vertiente multimodal que hoy es estándar (GPT-4V, Gemini, Midjourney, etc.) y alimentaron la explosión de generación de imágenes que redefinió la creatividad y el diseño asistidos.

Actores

OpenAI

Tecnologías

aprendizaje contrastivo texto-imagentexto a imagenembeddings multimodales

Geografía

Estados Unidos

Fuentes

  1. DALL-E (artículo)Wikipedia · 2026 Verificada
    Ver fuente

Conceptos relacionados

EmbeddingInferencia

Referencias al glosario del medio (en preparación).

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.