Revelando sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes
Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular sesgos, personalidades, estados de ánimo y otros conceptos abstractos ocultos en modelos de lenguaje grandes (LLM). Este enfoque utiliza máquinas de características recursivas (RFM) para identificar representaciones numéricas específicas asociadas a un concepto y modularlas, permitiendo potenciar o minimizar su influencia en las respuestas del modelo. Han probado el método en más de 500 conceptos generales en LLMs líderes, como 'teórico de la conspiración' o 'miedo al matrimonio', demostrando su utilidad para mejorar la seguridad y el rendimiento de los modelos. El método ofrece una forma dirigida y eficiente de explorar vulnerabilidades y optimizar el comportamiento de los LLMs.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.