Embedding
Una representación de un texto, palabra o imagen como una lista de números, de modo que cosas parecidas queden cerca en ese espacio numérico. Es como traducir significado a coordenadas.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
Un computador no "entiende" palabras; opera con números. Un embedding convierte cada palabra, frase o documento en un vector —una secuencia de números— construido de forma que elementos con significado cercano terminen con coordenadas cercanas. Así, "perro" y "gato" quedan más cerca entre sí que "perro" y "automóvil".
El avance que popularizó la idea fue word2vec (Mikolov et al., 2013), que además reveló propiedades sorprendentes: las relaciones podían sumarse y restarse, de modo que el vector de "rey" menos "hombre" más "mujer" caía cerca de "reina". Modelos posteriores como BERT (2018) llevaron la idea a representaciones que dependen del contexto: la misma palabra cambia de vector según la oración.
Los embeddings son la base de la búsqueda semántica y de RAG: para saber si un documento responde una pregunta, se comparan sus vectores en vez de sus palabras exactas. Son potentes, pero conviene no sobreinterpretarlos: codifican los sesgos de los datos con los que se entrenaron, y la elegancia geométrica de sus analogías no demuestra que el modelo "comprenda" el significado —ese último punto es una cuestión filosófica abierta, no un hecho establecido.
¿Por qué te importa?
Cada vez que buscas algo por significado y no por palabra exacta, o que un sistema te recomienda contenido similar, hay embeddings debajo. Saber que convierten parecido en números explica por qué la búsqueda moderna 'entiende' mejor lo que querías decir.
Ejemplos
- word2vec (2013), que mostró relaciones como rey − hombre + mujer ≈ reina.
- BERT (2018), que produjo embeddings que cambian según el contexto de la palabra.
- La búsqueda semántica y los sistemas de recomendación, que comparan vectores para hallar contenido afín.
Términos relacionados
Debate y controversia
Los embeddings heredan los sesgos de sus datos (de género, raza u otros), lo que ha generado investigación sobre medirlos y mitigarlos. Además, el que las analogías vectoriales 'funcionen' se toma a veces como prueba de comprensión, cuando en realidad es una propiedad estadística: la línea entre comportamiento competente y comprensión genuina es un debate filosófico, no resuelto.
Fuentes
Tomas Mikolov et al. · 2013
WebFetch confirmó título y autores (Mikolov, Chen, Corrado, Dean) en arXiv 1301.3781, 2013 (word2vec).
Jacob Devlin et al. · 2018
WebFetch confirmó título y autores (Devlin et al.) en arXiv 1810.04805, 2018.