Exponiendo sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes
Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular conceptos abstractos ocultos en modelos de lenguaje grandes (LLM), como sesgos, personalidades, estados de ánimo y otros. Utilizando máquinas de características recursivas (RFM), identifican representaciones numéricas de más de 500 conceptos y pueden dirigir el modelo para potenciar o atenuar su influencia en las respuestas. Por ejemplo, han demostrado cómo activar el concepto de 'teórico de la conspiración' en un modelo de visión-lenguaje. Este enfoque permite exponer vulnerabilidades, mejorar la seguridad y optimizar el rendimiento de los LLM. El estudio se publica en la revista Science.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.