Ir al contenido principalSaltar al contenido

Escalado de modelos de lenguaje intrínsecamente interpretables | Cómo construir LLMs transparentes y auditables sin sacrificar desempeño | Arquitecturas de lenguaje que explican sus decisiones de forma inherente para aplicaciones de confianza

interpretable modelsmodelos interpretablesexplainabilityexplicabilidadtransparent architecturearquitectura transparentetrustworthy AIIA confiablescaling lawsleyes de escaladoauditability

Abstract

PROBLEMA: los modelos de lenguaje grandes son cajas negras difíciles de auditar, lo que limita su adopción en dominios sensibles donde la confianza, la veracidad y la explicabilidad son esenciales. SOLUCIÓN: estudia el escalado de modelos de lenguaje intrínsecamente interpretables (inherently interpretable LMs), arquitecturas diseñadas para que sus decisiones sean entendibles por diseño, sin depender de métodos post-hoc de interpretación. METODOLOGÍA: propone y entrena modelos con arquitecturas que transparentan su razonamiento interno a distintas escalas, comparándolos con modelos opacos de tamaño similar y analizando el trade-off entre interpretabilidad y desempeño según las leyes de escalado. RESULTADOS: demuestra que es posible escalar modelos interpretables manteniendo un desempeño competitivo frente a modelos opacos en tareas de lenguaje y razonamiento, a la vez que se logra una explicabilidad intrínseca de las decisiones. RELEVANCIA: establece un camino hacia LLMs auditables y confiables, relevante para herramientas de veracidad, benchmarks de interpretabilidad y el despliegue responsable de sistemas agénticos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies