Estados Unidos
Documentado
CLIP y DALL·E abren la IA multimodal texto-imagen
En enero de 2021 OpenAI presentó a la vez DALL·E (generación de imágenes desde texto) y CLIP (aprendizaje conjunto de texto e imagen que clasifica visuales con instrucciones en lenguaje natural). Juntos demostraron que un mismo modelo podía tender un puente estable entre el lenguaje y la visión, algo hasta entonces esquivo.
Por qué es un hito
Arrancaron la vertiente multimodal que hoy es estándar (GPT-4V, Gemini, Midjourney, etc.) y alimentaron la explosión de generación de imágenes que redefinió la creatividad y el diseño asistidos.
Actores
OpenAI
Tecnologías
aprendizaje contrastivo texto-imagentexto a imagenembeddings multimodales
Geografía
Estados Unidos
Fuentes
- DALL-E (artículo)Wikipedia · 2026 VerificadaVer fuente
Antecedentes
Conceptos relacionados
EmbeddingInferencia
Referencias al glosario del medio (en preparación).