Exponiendo sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes
Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular conceptos abstractos ocultos en modelos de lenguaje grandes (LLM), como sesgos, personalidades, estados de ánimo y otros. El enfoque utiliza máquinas de características recursivas (RFM) para identificar representaciones numéricas de estos conceptos y modular su actividad, permitiendo potenciar o minimizar su influencia en las respuestas del modelo. Han probado el método en más de 500 conceptos en LLMs líderes, demostrando su capacidad para mejorar la seguridad y el rendimiento al revelar vulnerabilidades ocultas. Este avance permite una comprensión más profunda de cómo los LLM representan conocimiento humano y facilita la creación de modelos más especializados y seguros.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.