Ir al contenido principalSaltar al contenido
MIT News

Exponiendo sesgos, estados de ánimo, personalidades y conceptos abstractos ocultos en modelos de lenguaje grandes

Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un nuevo método para detectar y manipular conceptos abstractos ocultos en modelos de lenguaje grandes (LLM), como sesgos, personalidades, estados de ánimo y otros. El enfoque utiliza máquinas de características recursivas (RFM) para identificar representaciones numéricas de estos conceptos y modular su actividad, permitiendo potenciar o minimizar su influencia en las respuestas del modelo. Han probado el método en más de 500 conceptos en LLMs líderes, demostrando su capacidad para mejorar la seguridad y el rendimiento al revelar vulnerabilidades ocultas. Este avance permite una comprensión más profunda de cómo los LLM representan conocimiento humano y facilita la creación de modelos más especializados y seguros.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

modelos de lenguajesesgospersonalidadesRFMMITAdityanarayanan Radhakrishnanseguridad LLM
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies