🪄 Interpreto: Un kit unificado para la interpretabilidad de modelos Transformer
Interpreto es una nueva biblioteca open-source que facilita la interpretabilidad de modelos Transformer en tareas de NLP, cubriendo métodos de atribución y basados en conceptos para modelos de clasificación y generación. Se integra perfectamente con los transformers de Hugging Face, ofreciendo una API sencilla, herramientas de visualización y métricas de evaluación como Deletion e Insertion. La biblioteca soporta múltiples paradigmas de explicación, es extensible y proporciona flujos completos desde la extracción de activaciones hasta la interpretación de conceptos mediante técnicas como SAE, NMF y etiquetado con LLMs. Este lanzamiento es relevante para mejorar la confianza, equidad y depuración en sistemas de IA desplegados en entornos sensibles.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.