Ir al contenido principalSaltar al contenido
MIT News

Revelando sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes

Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular sesgos, personalidades, estados de ánimo y otros conceptos abstractos ocultos en modelos de lenguaje grandes (LLM). Este enfoque utiliza máquinas de características recursivas (RFM) para identificar representaciones numéricas específicas asociadas a un concepto y modularlas, permitiendo potenciar o minimizar su influencia en las respuestas del modelo. Han probado el método en más de 500 conceptos generales en LLMs líderes, como 'teórico de la conspiración' o 'miedo al matrimonio', demostrando su utilidad para mejorar la seguridad y el rendimiento de los modelos. El método ofrece una forma dirigida y eficiente de explorar vulnerabilidades y optimizar el comportamiento de los LLMs.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

sesgos en LLMmodelos de lenguajepersonalidades ocultasRFMMITAdityanarayanan Radhakrishnanseguridad IA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies