Filtración de datos de entrenamiento
Cuando un modelo de IA no sólo aprende patrones generales de sus datos de entrenamiento, sino que memoriza fragmentos literales —un párrafo, un correo, un fragmento de código— y puede reproducirlos palabra por palabra si se le pregunta de la forma correcta.
- Última revisión:
- Fuentes:
- 3 fuentes · 3 verificadas
Un modelo de lenguaje se entrena para generalizar, no para memorizar. Pero a la escala de miles de millones de parámetros y billones de tokens, cierta memorización literal es prácticamente inevitable: si una secuencia de texto aparece varias veces en el corpus, o es lo bastante inusual, el modelo puede terminar guardándola casi tal cual, no como un patrón abstracto sino como una copia recuperable.
Esto se demostró de forma sistemática con Carlini et al. (2021), quienes lograron extraer de GPT-2 —consultándolo de la forma adecuada— cientos de secuencias de texto verbatim, incluyendo información personal identificable, fragmentos de conversaciones y código, pese a que cada una aparecía una sola vez en el conjunto de entrenamiento. El hallazgo más inquietante: los modelos más grandes memorizan más, no menos.
Un trabajo posterior de Carlini et al. (2022) cuantificó esta relación: la memorización crece de forma log-lineal con tres factores —el tamaño del modelo, cuántas veces se repite una secuencia en el corpus, y cuánto contexto se le da al modelo en la consulta—. Y en 2023, Nasr, Carlini y colegas mostraron que incluso un modelo alineado con técnicas como RLHF, como ChatGPT, seguía siendo vulnerable: con un "ataque de divergencia" (pedirle que repitiera una palabra indefinidamente) lograron que el modelo dejara su comportamiento de chat y emitiera datos de entrenamiento memorizados a una tasa 150 veces mayor que en uso normal. La alineación no elimina la memorización: sólo la hace más difícil de provocar en condiciones normales.
En la práctica, este riesgo se manifiesta en dos frentes distintos. Uno es de privacidad: datos personales reales —direcciones, números, conversaciones— que terminan siendo recuperables desde un modelo público. El otro es de derechos de autor: texto o código protegido que el modelo puede reproducir casi textual, lo que ha derivado en demandas de medios y editoriales contra desarrolladores de modelos. Las mitigaciones típicas incluyen deduplicar el corpus de entrenamiento, filtrar las salidas y, en menor medida, entrenar con privacidad diferencial.
Lo que se discute hoy es, primero, si la memorización verbatim de material protegido por derechos de autor constituye infracción o cae bajo un uso transformador —un debate legal activo, no resuelto—; y segundo, si las técnicas actuales de alineamiento reducen el riesgo real de filtración o simplemente lo esconden de un uso casual, tal como sugiere el hallazgo de Nasr et al. sobre el ataque de divergencia.
¿Por qué te importa?
Si alguna vez te preguntaste por qué un modelo puede recitar un párrafo exacto de un libro o un correo con datos reales, este es el mecanismo técnico de fondo — y explica por qué 'borrar' un dato de un modelo ya entrenado es mucho más difícil que borrar una fila de una base de datos.
Ejemplos
- Carlini et al. (2021), 'Extracting Training Data from Large Language Models': extrajeron cientos de secuencias textuales verbatim de GPT-2, incluida información personal identificable, a partir de un único modelo público.
- Carlini et al. (2022), 'Quantifying Memorization Across Neural Language Models': mostraron que la memorización crece de forma log-lineal con el tamaño del modelo, la repetición de una secuencia en el corpus y la longitud del contexto de la consulta.
- Nasr, Carlini et al. (2023): con un 'ataque de divergencia' —pedirle a ChatGPT repetir una palabra indefinidamente— lograron que el modelo emitiera datos de entrenamiento memorizados a una tasa 150 veces mayor que en su comportamiento normal de chat.
Términos relacionados
Debate y controversia
Está en curso un debate legal activo —incluidas demandas de editoriales y medios contra desarrolladores de modelos— sobre si la memorización verbatim de texto protegido por derechos de autor constituye infracción o cae bajo un uso transformador. También se discute si el ajuste con RLHF reduce el riesgo real de filtración o sólo lo hace más difícil de provocar en condiciones normales de uso: el hallazgo de Nasr et al. (2023) sobre el ataque de divergencia sugiere lo segundo.
Fuentes
Nicholas Carlini et al. · 2021
WebFetch confirmó título, lista de autores y contenido en arXiv 2012.07805. El preprint se subió en diciembre de 2020 y se revisó en junio de 2021; se cita como 2021 por su publicación en USENIX Security 2021.
Nicholas Carlini et al. · 2022
WebFetch confirmó título, autores y el hallazgo de las tres relaciones log-lineales de memorización (tamaño del modelo, duplicación, longitud de contexto) en arXiv 2202.07646.
Milad Nasr, Nicholas Carlini et al. · 2023
WebFetch confirmó título, autores y el 'ataque de divergencia' sobre ChatGPT (tasa de extracción 150 veces mayor) en arXiv 2311.17035, noviembre de 2023.