Privacidad diferencial
Una técnica matemática que permite publicar estadísticas o entrenar modelos a partir de datos de muchas personas garantizando que el resultado casi no cambia si se agrega o se quita a una persona específica del conjunto, de forma que nadie puede deducir, mirando el resultado, si tus datos estaban ahí.
- Última revisión:
- Fuentes:
- 3 fuentes · 3 verificadas
La privacidad diferencial es una definición matemática, no una promesa vaga de "protegemos tus datos". Formalizada por Cynthia Dwork y colegas a mediados de la década de 2000 y sistematizada en el libro de referencia de Dwork y Roth (2014), su idea central es agregar ruido aleatorio calibrado a un cálculo estadístico de modo que el resultado sea casi idéntico exista o no exista una persona particular en el conjunto de datos. La garantía no depende de qué tan poderoso sea el atacante ni de qué otra información tenga: es una propiedad matemática del mecanismo, no una suposición sobre el mundo.
En términos accesibles, funciona así: en vez de responder una pregunta ("¿cuántas personas de esta comuna tienen tal condición?") con el número exacto, el mecanismo responde ese número más un ruido aleatorio de una magnitud controlada por un parámetro (llamado épsilon). Cuanto menor el épsilon, mayor la privacidad y menor la precisión del resultado; cuanto mayor el épsilon, al revés. Existen variantes: la privacidad diferencial "local", donde el ruido se agrega en tu propio dispositivo antes de que el dato salga de ahí (así el servidor nunca ve tu dato real), y la "central", donde el ruido se agrega después de recolectar los datos crudos.
Apple fue pionera en el despliegue masivo de privacidad diferencial local: desde 2017 la usa para aprender qué emojis son populares o qué sitios consumen mucha batería en Safari, sin que sus servidores reciban jamás el dato sin randomizar de un usuario individual, a escala de cientos de millones de dispositivos. La Oficina del Censo de Estados Unidos adoptó una variante (privacidad diferencial zero-concentrada) como su Sistema de Evasión de Divulgación para el Censo 2020, agregando ruido calibrado a los conteos en seis niveles geográficos anidados antes de publicarlos.
El caso del Censo es también el mejor ejemplo de la tensión que genera esta técnica: introducir ruido matemáticamente garantizado protege contra la reidentificación, pero distorsiona los conteos exactos que demógrafos y autoridades de redistritaje electoral necesitaban para trazar límites de distritos legislativos con precisión. No es un defecto de implementación: es el costo inherente del compromiso privacidad-utilidad que la técnica formaliza explícitamente en vez de esconder.
En el contexto de modelos de lenguaje, la privacidad diferencial se propone —con adopción todavía limitada en la industria— como una manera de entrenar modelos que reduzcan el riesgo de memorizar y luego reproducir literalmente datos de una persona específica, el problema que se describe en la entrada de filtración de datos de entrenamiento. El desafío es que aplicarla durante el entrenamiento de un modelo grande normalmente reduce su calidad, lo que ha frenado su uso generalizado más allá de casos con datos especialmente sensibles.
¿Por qué te importa?
Cuando una empresa o un gobierno dice que 'protege tu privacidad' al publicar estadísticas o entrenar un modelo con tus datos, la privacidad diferencial es una de las pocas formas de que esa promesa sea una garantía matemática verificable y no sólo una política interna.
Ejemplos
- El sistema de privacidad diferencial local de Apple (2017), usado para detectar emojis populares y sitios que consumen batería en Safari sin que el servidor reciba el dato crudo de ningún usuario.
- El Sistema de Evasión de Divulgación del Censo 2020 de Estados Unidos, que usa privacidad diferencial zero-concentrada para proteger los conteos publicados en seis niveles geográficos.
- La adopción incipiente y todavía limitada de entrenamiento con privacidad diferencial para reducir el riesgo de que modelos de lenguaje memoricen datos personales verbatim.
Términos relacionados
Debate y controversia
El caso del Censo 2020 de EE.UU. generó un debate real y documentado: demógrafos y autoridades estatales de redistritaje electoral objetaron que el ruido introducido por privacidad diferencial distorsionaba conteos pequeños necesarios para trazar distritos legislativos con precisión legal, mientras la Oficina del Censo sostenía que sin esa protección los datos eran vulnerables a reidentificación. El debate de fondo —cuánta utilidad estadística sacrificar por cuánta garantía de privacidad— sigue abierto y depende de qué valor de épsilon se elija en cada caso.
Fuentes
Cynthia Dwork y Aaron Roth · 2014
WebFetch abrió el PDF y confirmó la estructura de capítulos y el tratamiento de la 'definición formal' de privacidad diferencial (sección 2.3); el año 2014 y la publicación en Foundations and Trends in Theoretical Computer Science (vol. 9, pp. 211-407) se corroboraron por búsqueda cruzada.
- Learning with Privacy at Scale Verificada
Apple Machine Learning Research · 2017
WebFetch confirmó fecha de publicación (6 de diciembre de 2017) y contenido: arquitectura de privacidad diferencial local de Apple a escala de cientos de millones de dispositivos.
U.S. Census Bureau · 2022
WebFetch confirmó la página oficial de la Oficina del Censo de EE.UU. (working paper CED-WP-2022-002, abril de 2022) y la descripción técnica de la privacidad diferencial zero-concentrada usada en el Censo 2020.