Exploring attention patterns and neural activations in transformer architectures for sequence classification in context free grammars
Supervisor(es): Yovine, Sergio Fabián - Mayr Ojeda, Franz
Resumen:
El siguiente proyecto investiga los patrones de atención y activaciones neuronales en modelos con arquitecturas Transformer, específicamente en tareas de clasificación de secuencias de lenguajes Dyck-k, que son ejemplos de gramáticas libres de contexto. Se analiza si los Transformers pueden modelar y clasificar estos lenguajes, centrándose en su capacidad de aprender estructuras recursivas. Los resultados empíricos muestran que los patrones de atención coinciden con las dependencias estructurales de las secuencias. Se observó que las máscaras bidireccionales mejoran significativamente el rendimiento, mientras que las máscaras causales limitan la entrenabilidad. Además, el proyecto destaca la importancia de los mecanismos de atención para reconocer lenguajes jerárquicos. Se desarrolló la librería "transformer-checker", que facilita el entrenamiento, evaluación y visualización de Transformers en tareas de lenguajes formales, con un módulo de explicabilidad para analizar las matrices de atención. El código está disponible públicamente.
| 2024 | |
|
PROYECTOS-ID DESARROLLO DE SOFTWARE INTELIGENCIA ARTIFICIAL REDES NEURONALES MODELOS DE LENGUAJE GRANDE LENGUAJES FORMALES |
|
| Inglés | |
| Universidad ORT Uruguay | |
| RAD | |
|
https://hdl.handle.net/20.500.11968/7131
http://hdl.handle.net/20.500.11968/7131 |
|
| Acceso abierto | |
| Acceso abierto |