Estados Unidos
Documentado
CLIP y DALL·E abren la IA multimodal texto-imagen
En enero de 2021 OpenAI presentó a la vez DALL·E (generación de imágenes desde texto) y CLIP (aprendizaje conjunto de texto e imagen que clasifica visuales con instrucciones en lenguaje natural). Juntos demostraron que un mismo modelo podía tender un puente estable entre el lenguaje y la visión, algo hasta entonces esquivo.
Por qué es un hito
Arrancaron la vertiente multimodal que hoy es estándar (GPT-4V, Gemini, Midjourney, etc.) y alimentaron la explosión de generación de imágenes que redefinió la creatividad y el diseño asistidos.
Actores
OpenAI
Tecnologías
aprendizaje contrastivo texto-imagentexto a imagenembeddings multimodales
Geografía
Estados Unidos
Fuentes
- DALL-E (artículo)Wikipedia · 2026 VerificadaVer fuente
Antecedentes
Conceptos relacionados
EmbeddingInferencia
Referencias al glosario del medio (en preparación).
Aparece en los dossiers
- Emociones sin biología: qué está ocurriendo dentro de los modelos de IA
- La IA no necesita despertar para gobernarnos
- La reinvención del trabajo en la era de la IA
- La singularidad no es un día en el calendario
- Medir el afecto artificial: el protocolo, sus trampas y el experimento que falta
- Mientras el robot corría, otro aprendió a operar
- Neuronas humanas que computan: qué hace Cortical Labs, y de quién son esas células