Explicaciones contrafactuales multi-objetivo para clasificadores binarios de imágenes : un marco de generación y evaluación

Malowany, Ariel

Supervisor(es): Gardella, Marina - Raad, Lara

Resumen:

El uso creciente de modelos de aprendizaje automático con procesos de decisión opacos en escenarios donde las decisiones automatizadas afectan el bienestar de las personas ha impulsado el desarrollo del campo de la inteligencia artificial explicable (XAI). El dominio de imágenes constituye un caso de especial interés dentro de este campo, dado que las imágenes presentan atributos interdependientes cuyas interacciones son modeladas de forma no interpretable, al tiempo que aplicaciones críticas como la verificación biométrica o el reconocimiento facial intensifican la demanda de explicaciones. En este dominio, los métodos de explicabilidad predominantes no ofrecen indicaciones sobre qué cambiar para obtener un resultado diferente, y su evaluación tiende a ser anecdótica y a carecer de métricas estandarizadas. Las explicaciones contrafactuales responden a estas limitaciones al describir cómo debe cambiar una instancia para que el modelo modifique su decisión, y sus propiedades formales permiten definir criterios de evaluación cuantitativos y reproducibles. La presente investigación parte de la formalización de la demanda de explicabilidad mediante el análisis de casos documentados en dominios críticos y la caracterización de los objetivos y dimensiones que permiten clasificar los métodos del campo. Sobre esta base, se replica y extiende un método de generación de contrafactuales multi-objetivo en el dominio de imágenes, incorporando modificaciones que lo hacen aplicable a cualquier modelo generativo condicional y que amplían su alcance respecto a la propuesta original. En paralelo, se propone y valida un marco de evaluación cuantitativa para explicaciones contrafactuales en clasificación binaria de imágenes, adaptando métricas existentes para datos tabulares y estableciendo la correspondencia entre las propiedades de las explicaciones y los indicadores que las operacionalizan. Los experimentos se realizaron sobre un clasificador de género de estado del arte basado en imágenes faciales, utilizando una red generativa condicional a atributos y una formulación de optimización que busca simultáneamente maximizar la validez, la similitud, la minimalidad y la plausibilidad de las explicaciones generadas. El marco de evaluación demostró que las métricas propuestas capturan adecuadamente las propiedades teóricas esperadas, lo cual se refleja en la coherencia de las relaciones entre indicadores y permite que el método pueda ser replicado, comparado y mejorado de manera objetiva. A su vez, los resultados experimentales permitieron verificar compromisos entre las propiedades de las explicaciones, confirmar la incidencia de la función de distancia en los contrafactuales generados e identificar atributos relevantes para la decisión del clasificador.

Detalles Bibliográficos
2026
Explicabilidad
XAI
Interpretabilidad
Transparencia
Explicaciones contrafactuales
Contrafácticos
Clasificación de imágenes
Procesamiento de imágenes
Aprendizaje profundo
Explicaciones post-hoc
Caja negra
Español
Universidad de la República
COLIBRI
https://hdl.handle.net/20.500.12008/56332
Acceso abierto
Licencia Creative Commons Atribución - No Comercial - Sin Derivadas (CC - By-NC-ND 4.0)