Escalado de modelos de lenguaje intrínsecamente interpretables | Cómo construir LLMs transparentes y auditables sin sacrificar desempeño | Arquitecturas de lenguaje que explican sus decisiones de forma inherente para aplicaciones de confianza
Abstract
PROBLEMA: los modelos de lenguaje grandes son cajas negras difíciles de auditar, lo que limita su adopción en dominios sensibles donde la confianza, la veracidad y la explicabilidad son esenciales. SOLUCIÓN: estudia el escalado de modelos de lenguaje intrínsecamente interpretables (inherently interpretable LMs), arquitecturas diseñadas para que sus decisiones sean entendibles por diseño, sin depender de métodos post-hoc de interpretación. METODOLOGÍA: propone y entrena modelos con arquitecturas que transparentan su razonamiento interno a distintas escalas, comparándolos con modelos opacos de tamaño similar y analizando el trade-off entre interpretabilidad y desempeño según las leyes de escalado. RESULTADOS: demuestra que es posible escalar modelos interpretables manteniendo un desempeño competitivo frente a modelos opacos en tareas de lenguaje y razonamiento, a la vez que se logra una explicabilidad intrínseca de las decisiones. RELEVANCIA: establece un camino hacia LLMs auditables y confiables, relevante para herramientas de veracidad, benchmarks de interpretabilidad y el despliegue responsable de sistemas agénticos.