Alucinación
Cuando un modelo genera información falsa, inventada o no respaldada por sus datos ni por la evidencia disponible, y la presenta con la misma fluidez y confianza que una respuesta correcta.
- Última revisión:
- Fuentes:
- 2 fuentes · 2 verificadas
El nombre es una metáfora tomada de la psicología, adoptada por la comunidad técnica para describir un comportamiento observable, no un diagnóstico literal: un modelo no "ve cosas que no existen" en el sentido humano, produce texto plausible que no corresponde a los hechos ni a la fuente que se le dio. Ji et al. (2022) sistematizaron el término con una encuesta amplia sobre generación de lenguaje natural, distinguiendo la alucinación "intrínseca" (contradice la fuente que se le entregó) de la "extrínseca" (agrega algo que no se puede verificar con esa fuente), a través de tareas como resumen, traducción, diálogo y preguntas y respuestas.
El modelo no tiene, por diseño, un módulo separado que distinga "lo que sé con certeza" de "lo que estoy completando por patrón": en cada paso predice la palabra más probable según lo que aprendió, y esa predicción puede sonar tan fluida cuando es correcta como cuando no lo es. No hay una señal interna de "no sé esto" salvo la que se entrene explícitamente para expresarla, y esa misma completitud estadística es lo que hace tan difícil, en la práctica, distinguir a simple vista una respuesta acertada de una inventada.
En el uso cotidiano aparece de formas muy concretas: citas legales o bibliográficas que no existen, funciones de programación o parámetros de una librería que nunca se implementaron, resúmenes que le atribuyen a un documento algo que no dice, o respuestas médicas que suenan seguras sin estar respaldadas. El riesgo crece justamente donde el usuario no tiene forma fácil de contrastar la respuesta.
Las mitigaciones más usadas —RAG para fundamentar la respuesta en documentos concretos, ajuste fino sobre datos verificados, revisión humana— reducen la frecuencia del problema, pero no lo eliminan. Xu, Jain y Kankanhalli (2024) plantean, con un argumento formal de teoría del aprendizaje, que un modelo de lenguaje usado como "solucionador general de problemas" no puede aprender todas las funciones computables posibles y por lo tanto alucinará inevitablemente en algún grado; es un resultado teórico, discutido, no una medición empírica de cuánto alucina un modelo concreto hoy.
Conviene ser cuidadoso con el lenguaje: decir que un modelo "miente" implica intención, y decir que "alucina como una persona" sugiere una experiencia subjetiva que no hay evidencia de que exista. Lo que se describe es un comportamiento funcional —salida no fundamentada presentada con fluidez— y ese matiz importa para no sobre-interpretar ni sub-estimar el problema.
¿Por qué te importa?
Una respuesta inventada suena exactamente igual de segura que una correcta, y eso la vuelve peligrosa justo donde más confiamos: en trámites legales, salud, estudio o decisiones de negocio. Saber que puede pasar te recuerda a verificar antes de actuar sobre lo que te contestó un modelo.
Ejemplos
- Mata v. Avianca (2023): abogados en Nueva York presentaron un escrito judicial con citas de jurisprudencia inventadas por ChatGPT, y fueron sancionados por el tribunal.
- Moffatt v. Air Canada (2024): un tribunal canadiense obligó a la aerolínea a cumplir una política de reembolso por duelo que su propio chatbot había inventado.
- El error público de la demo de Google Bard (febrero de 2023), que atribuyó al telescopio espacial James Webb un descubrimiento que no le correspondía.
Términos relacionados
Debate y controversia
Hay debate técnico real sobre si la alucinación es reducible a niveles marginales con mejores técnicas (la posición de buena parte de la industria) o si es una limitación estructural del enfoque estadístico de estos modelos, como argumentan Xu et al. (2024) con su resultado formal de "imposibilidad". También se discute si el término mismo antropomorfiza de más un fenómeno que es, en esencia, generación fluida sin verificación de hechos.
Fuentes
Ziwei Ji et al. · 2022
WebFetch confirmó título exacto y autora principal (Ziwei Ji et al.) en arXiv 2202.03629, 2022 (publicado en ACM Computing Surveys); cubre alucinación intrínseca/extrínseca en NLG.
Ziwei Xu, Sanjay Jain, Mohan Kankanhalli · 2024
WebFetch confirmó título y autores en arXiv 2401.11817, 2024; formaliza por qué la alucinación no puede eliminarse por completo en un LLM usado como solucionador general de problemas.