Ir al contenido principal
Volver al Glosario

Filtración de datos de entrenamiento

Cuando un modelo de IA no sólo aprende patrones generales de sus datos de entrenamiento, sino que memoriza fragmentos literales —un párrafo, un correo, un fragmento de código— y puede reproducirlos palabra por palabra si se le pregunta de la forma correcta.

Última revisión:
Fuentes:
3 fuentes · 3 verificadas

Un modelo de lenguaje se entrena para generalizar, no para memorizar. Pero a la escala de miles de millones de parámetros y billones de tokens, cierta memorización literal es prácticamente inevitable: si una secuencia de texto aparece varias veces en el corpus, o es lo bastante inusual, el modelo puede terminar guardándola casi tal cual, no como un patrón abstracto sino como una copia recuperable.

Esto se demostró de forma sistemática con Carlini et al. (2021), quienes lograron extraer de GPT-2 —consultándolo de la forma adecuada— cientos de secuencias de texto verbatim, incluyendo información personal identificable, fragmentos de conversaciones y código, pese a que cada una aparecía una sola vez en el conjunto de entrenamiento. El hallazgo más inquietante: los modelos más grandes memorizan más, no menos.

Un trabajo posterior de Carlini et al. (2022) cuantificó esta relación: la memorización crece de forma log-lineal con tres factores —el tamaño del modelo, cuántas veces se repite una secuencia en el corpus, y cuánto contexto se le da al modelo en la consulta—. Y en 2023, Nasr, Carlini y colegas mostraron que incluso un modelo alineado con técnicas como RLHF, como ChatGPT, seguía siendo vulnerable: con un "ataque de divergencia" (pedirle que repitiera una palabra indefinidamente) lograron que el modelo dejara su comportamiento de chat y emitiera datos de entrenamiento memorizados a una tasa 150 veces mayor que en uso normal. La alineación no elimina la memorización: sólo la hace más difícil de provocar en condiciones normales.

En la práctica, este riesgo se manifiesta en dos frentes distintos. Uno es de privacidad: datos personales reales —direcciones, números, conversaciones— que terminan siendo recuperables desde un modelo público. El otro es de derechos de autor: texto o código protegido que el modelo puede reproducir casi textual, lo que ha derivado en demandas de medios y editoriales contra desarrolladores de modelos. Las mitigaciones típicas incluyen deduplicar el corpus de entrenamiento, filtrar las salidas y, en menor medida, entrenar con privacidad diferencial.

Lo que se discute hoy es, primero, si la memorización verbatim de material protegido por derechos de autor constituye infracción o cae bajo un uso transformador —un debate legal activo, no resuelto—; y segundo, si las técnicas actuales de alineamiento reducen el riesgo real de filtración o simplemente lo esconden de un uso casual, tal como sugiere el hallazgo de Nasr et al. sobre el ataque de divergencia.

¿Por qué te importa?

Si alguna vez te preguntaste por qué un modelo puede recitar un párrafo exacto de un libro o un correo con datos reales, este es el mecanismo técnico de fondo — y explica por qué 'borrar' un dato de un modelo ya entrenado es mucho más difícil que borrar una fila de una base de datos.

Ejemplos

  • Carlini et al. (2021), 'Extracting Training Data from Large Language Models': extrajeron cientos de secuencias textuales verbatim de GPT-2, incluida información personal identificable, a partir de un único modelo público.
  • Carlini et al. (2022), 'Quantifying Memorization Across Neural Language Models': mostraron que la memorización crece de forma log-lineal con el tamaño del modelo, la repetición de una secuencia en el corpus y la longitud del contexto de la consulta.
  • Nasr, Carlini et al. (2023): con un 'ataque de divergencia' —pedirle a ChatGPT repetir una palabra indefinidamente— lograron que el modelo emitiera datos de entrenamiento memorizados a una tasa 150 veces mayor que en su comportamiento normal de chat.

Términos relacionados

Debate y controversia

Está en curso un debate legal activo —incluidas demandas de editoriales y medios contra desarrolladores de modelos— sobre si la memorización verbatim de texto protegido por derechos de autor constituye infracción o cae bajo un uso transformador. También se discute si el ajuste con RLHF reduce el riesgo real de filtración o sólo lo hace más difícil de provocar en condiciones normales de uso: el hallazgo de Nasr et al. (2023) sobre el ataque de divergencia sugiere lo segundo.

Fuentes

Un medio de señales del futuro: observa lo que está cambiando en tecnología, ciencia, regulación y sociedad, y lo publica como noticia, análisis o tesis de futuro. Cada pieza cita sus fuentes.

© 2026 HumanOS Future · medio de Sinapsis SpA. Las piezas de tipo tesis y opinión no son hechos consumados.