Cómo los LLMs inventan perfiles de usuario y por qué el autocontrol engaña | Análisis empírico de la fabricación de perfiles y la falsa sensación de fiabilidad del self-monitoring | Técnica para detectar y mitigar alucinaciones en sistemas de personalización basados en modelos de lenguaje
Abstract
PROBLEMA: Los sistemas de personalización basados en LLMs a menudo infieren perfiles de usuario a partir de pistas mínimas. Este trabajo demuestra que los modelos fabrican sistemáticamente perfiles de usuario inexactos y, lo que es más grave, que el self-monitoring (autocontrol) da una falsa sensación de fiabilidad sobre estas invenciones. SOLUCIÓN: El paper caracteriza empíricamente este 'espejismo de personalización' y demuestra que los mecanismos de autocontrol no detectan la fabricación de perfiles, mostrando por qué este enfoque falla y proponiendo vías para lograrlo. METODOLOGÍA: Se diseñan experimentos controlados con modelos de lenguaje en tareas de inferencia de preferencias y perfiles, evaluando tanto las predicciones como las señales de confianza/autocontrol de los modelos frente a los perfiles reales de los usuarios. RESULTADOS: Los perfiles fabricados son ubicuos y los scores de autocontrol correlacionan débilmente con la exactitud real, evidenciando que confiar en el self-monitoring como salvaguarda es peligroso. El estudio cuantifica el desajuste entre confianza declarada y veracidad efectiva. RELEVANCIA: Es directamente relevante para construir sistemas LLM fiables en personalización, asistentes y agentes, donde las alucinaciones sobre el usuario pueden propagar acciones incorrectas; aporta lecciones sobre calibración de confianza aplicables a cualquier pipeline que use LLMs.