Relational non-verbatim unintended memorization in large language models

Morón Santos, Santiago

Supervisor(es): Fabián Yovine, Sergio

Resumen:

El siguiente proyecto presenta una investigación orientada al análisis de la memorización no intencionada en modelos de lenguaje y los riesgos asociados a la posible exposición de información sensible. A medida que estas tecnologías son adoptadas en entornos que procesan datos confidenciales, resulta fundamental comprender hasta qué punto los modelos pueden almacenar y revelar información presente en sus datos de entrenamiento. El trabajo realiza un estudio post-hoc de los mecanismos de memorización, comenzando por la unificación de métricas ampliamente utilizadas en la literatura. En particular, demuestra que las métricas de exposición y (n, p)-discoverable extraction representan diferentes formas de medir un mismo fenómeno subyacente. Sobre esta base, se proponen mejoras metodológicas que permiten evaluar la memorización tanto de secuencias individuales como de conjuntos de texto, además de analizar el impacto de distintas estrategias de decodificación, como el muestreo top-k, en la probabilidad de revelar contenido memorizado. Como principal aporte, la investigación introduce una nueva métrica denominada relational (n, p)-discoverable extraction, diseñada para identificar la memorización de relaciones semánticas y estructurales entre fragmentos de información, superando las limitaciones de los enfoques centrados únicamente en coincidencias literales. La aplicación de esta métrica permitió desarrollar un ataque experimental sobre un modelo de lenguaje de última generación, logrando extraer relaciones de datos que no podían ser detectadas mediante métodos previos. Finalmente, el trabajo evalúa el uso de Privacidad Diferencial durante el entrenamiento como estrategia de mitigación. Los resultados obtenidos aportan evidencia empírica de que esta técnica reduce de manera significativa el riesgo de memorización no intencionada y, por consiguiente, la posibilidad de filtración de información sensible.

Detalles Bibliográficos
2026
PROYECTOS-ID
DESARROLLO DE SOFTWARE
MODELOS DE LENGUAJE
PRIVACIDAD DIFERENCIAL
Inglés
Universidad ORT Uruguay
RAD
https://hdl.handle.net/20.500.11968/7906
http://hdl.handle.net/20.500.11968/7906
Acceso abierto
Acceso abierto