Ir al contenido principalSaltar al contenido

CoRT: Optimización de políticas guiada por rúblicas a nivel de token mediante repetición contrafactual | Mejora de la precisión en LLMs mediante corrección de errores a nivel de palabra | Técnica de entrenamiento de refuerzo para procesos de razonamiento multietapa en IA

CoRTCounterfactual Replayrepetición contrafactualtoken-level rubric均衡policy optimizationoptimización de políticasByteDancePPO alternate

Abstract

PROBLEMA: La optimización de políticas estándar (como PPO) suele operar a nivel de secuencia completa, lo que dificulta la corrección de errores específicos en pasos intermedios (tokens) que llevan a una respuesta final incorrecta. SOLUCIÓN: Se propone CoRT (Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization), un método que utiliza repetición contrafactual para evaluar y corregir tokens individuales basándose en una rúbrica de grano fino. METODOLOGÍA: El sistema genera trayectorias alternativas ('contrafactuales') en puntos críticos de decisión y utiliza un generador de rúblicas para asignar crédito o penalización a nivel de token, optimizando la política en base a estos hitos internos. RESULTADOS: CoRT muestra una eficiencia de muestra superior y una mayor precisión en tareas de resolución de problemas matemáticos y razonamiento lógico comparado con RLHF tradicional. RELEVANCIA: Clave para reducir el error de arrastre en razonamientos largos y mejorar la precisión factual de los agentes.