Exploring attention patterns and neural activations in transformer architectures for sequence classification in context free grammars

Molinolo De Ferrari, Matías

Supervisor(es): Yovine, Sergio Fabián - Mayr Ojeda, Franz

Resumen:

El siguiente proyecto investiga los patrones de atención y activaciones neuronales en modelos con arquitecturas Transformer, específicamente en tareas de clasificación de secuencias de lenguajes Dyck-k, que son ejemplos de gramáticas libres de contexto. Se analiza si los Transformers pueden modelar y clasificar estos lenguajes, centrándose en su capacidad de aprender estructuras recursivas. Los resultados empíricos muestran que los patrones de atención coinciden con las dependencias estructurales de las secuencias. Se observó que las máscaras bidireccionales mejoran significativamente el rendimiento, mientras que las máscaras causales limitan la entrenabilidad. Además, el proyecto destaca la importancia de los mecanismos de atención para reconocer lenguajes jerárquicos. Se desarrolló la librería "transformer-checker", que facilita el entrenamiento, evaluación y visualización de Transformers en tareas de lenguajes formales, con un módulo de explicabilidad para analizar las matrices de atención. El código está disponible públicamente.

Detalles Bibliográficos
2024
PROYECTOS-ID
DESARROLLO DE SOFTWARE
INTELIGENCIA ARTIFICIAL
REDES NEURONALES
MODELOS DE LENGUAJE GRANDE
LENGUAJES FORMALES
Inglés
Universidad ORT Uruguay
RAD
https://hdl.handle.net/20.500.11968/7131
http://hdl.handle.net/20.500.11968/7131
Acceso abierto
Acceso abierto