Saturation-Aware Advantage Reweighting: aprender lo que falta, no lo que ya se domina | Optimización de políticas con múltiples recompensas que evita la sobreexplotación de objetivos saturados | Técnica de entrenamiento multiobjetivo para RLHF y RLAIF que equilibra utilidad, seguridad y estilo en LLMs
Abstract
PROBLEMA: al optimizar políticas con múltiples recompensas (por ejemplo, utilidad, seguridad y estilo en RLHF o RLAIF), la mayoría de los métodos agregan o ponderan las señales sin tener en cuenta que algunas recompensas se saturan: el modelo ya domina un objetivo, así que seguir optimizándolo desperdicia capacidad y puede degradar los objetivos menos dominados. SOLUCIÓN: el paper propone Saturation Aware Advantage Reweighting (SAAR), una técnica de policy optimization que repondera las ventajas (advantages) de cada recompensa según su nivel de saturación, enfocando el gradiente en 'lo que queda por aprender' en lugar de 'lo que ya está dominado'. METODOLOGÍA: se estima la saturación de cada señal de recompensa durante el entrenamiento y se recalcula el peso del advantage antes de cada actualización de política; el método se integra sobre optimizadores multi-reward estándar y se valida en entornos de entrenamiento de agentes y de modelos de lenguaje con conjuntos de recompensas en conflicto. RESULTADOS: SAAR consigue mejoras consistentes en los objetivos menos dominados sin sacrificar las recompensas ya saturadas, reduce la regresión entre objetivos y acelera la convergencia frente a líneas base de promedio ponderado y reweighting estático, con un coste adicional mínimo. RELEVANCIA: ofrece un mecanismo de entrenamiento sin cambios de arquitectura para alinear LLMs y agentes con múltiples criterios, directamente aplicable a pipelines de RLHF/RLAIF y a optimización multiobjetivo donde equilibrio entre objetivos es crítico.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.