Ir al contenido principalSaltar al contenido
MIT News

Exponiendo sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes

Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular conceptos abstractos ocultos en modelos de lenguaje grandes (LLM), como sesgos, personalidades, estados de ánimo y otros. Utilizando máquinas de características recursivas (RFM), identifican representaciones numéricas de más de 500 conceptos y pueden dirigir el modelo para potenciar o atenuar su influencia en las respuestas. Por ejemplo, han demostrado cómo activar el concepto de 'teórico de la conspiración' en un modelo de visión-lenguaje. Este enfoque permite exponer vulnerabilidades, mejorar la seguridad y optimizar el rendimiento de los LLM. El estudio se publica en la revista Science.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

modelos de lenguajesesgospersonalidadesRFMseguridad LLMMITAdityanarayanan Radhakrishnan
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies