De RLVR a RLSVR: Recompensas autoverificables para la auto-mejora de LLMs | Cómo permitir que los modelos de lenguaje aprendan por sí mismos en tareas abiertas | Marco de entrenamiento para IA con verificación autónoma de respuestas
Abstract
PROBLEMA: Los métodos actuales de aprendizaje por refuerzo con recompensas verificables (RLVR) están limitados a dominios con respuestas exactas (matemáticas/código), lo que impide la auto-mejora de los LLMs en tareas creativas o abiertas donde no existe una única solución correcta. SOLUCIÓN: El paper introduce RLSVR (Reinforcement Learning with Self-Verifiable Rewards), un marco que transforma tareas abiertas en formatos de autoverificación mediante la generación de múltiples candidatos y el uso del propio modelo como juez crítico bajo restricciones metodológicas. METODOLOGÍA: Utilizan una técnica de transformación de tareas que induce al modelo a generar una lógica de verificación junto con la respuesta, evaluando la consistencia semántica y lógica. RESULTADOS: RLSVR demuestra una mejora significativa en benchmarks de razonamiento general y redacción creativa, superando a modelos entrenados con RLVR tradicional y acercándose al rendimiento de modelos supervisados por humanos. RELEVANCIA: Es fundamental para crear sistemas de IA que puedan evolucionar de forma autónoma sin depender de datasets masivos etiquetados por personas.