Relational non-verbatim unintended memorization in large language models
Supervisor(es): Fabián Yovine, Sergio
Resumen:
El siguiente proyecto presenta una investigación orientada al análisis de la memorización no intencionada en modelos de lenguaje y los riesgos asociados a la posible exposición de información sensible. A medida que estas tecnologías son adoptadas en entornos que procesan datos confidenciales, resulta fundamental comprender hasta qué punto los modelos pueden almacenar y revelar información presente en sus datos de entrenamiento. El trabajo realiza un estudio post-hoc de los mecanismos de memorización, comenzando por la unificación de métricas ampliamente utilizadas en la literatura. En particular, demuestra que las métricas de exposición y (n, p)-discoverable extraction representan diferentes formas de medir un mismo fenómeno subyacente. Sobre esta base, se proponen mejoras metodológicas que permiten evaluar la memorización tanto de secuencias individuales como de conjuntos de texto, además de analizar el impacto de distintas estrategias de decodificación, como el muestreo top-k, en la probabilidad de revelar contenido memorizado. Como principal aporte, la investigación introduce una nueva métrica denominada relational (n, p)-discoverable extraction, diseñada para identificar la memorización de relaciones semánticas y estructurales entre fragmentos de información, superando las limitaciones de los enfoques centrados únicamente en coincidencias literales. La aplicación de esta métrica permitió desarrollar un ataque experimental sobre un modelo de lenguaje de última generación, logrando extraer relaciones de datos que no podían ser detectadas mediante métodos previos. Finalmente, el trabajo evalúa el uso de Privacidad Diferencial durante el entrenamiento como estrategia de mitigación. Los resultados obtenidos aportan evidencia empírica de que esta técnica reduce de manera significativa el riesgo de memorización no intencionada y, por consiguiente, la posibilidad de filtración de información sensible.
| 2026 | |
|
PROYECTOS-ID DESARROLLO DE SOFTWARE MODELOS DE LENGUAJE PRIVACIDAD DIFERENCIAL |
|
| Inglés | |
| Universidad ORT Uruguay | |
| RAD | |
|
https://hdl.handle.net/20.500.11968/7906
http://hdl.handle.net/20.500.11968/7906 |
|
| Acceso abierto | |
| Acceso abierto |