Ir al contenido principalSaltar al contenido

CoRT: Optimización de políticas guiada por rúblicas a nivel de token mediante repetición contrafactual | Mejora de la precisión en LLMs mediante corrección de errores a nivel de palabra | Técnica de entrenamiento de refuerzo para procesos de razonamiento multietapa en IA

CoRTCounterfactual Replayrepetición contrafactualtoken-level rubric均衡policy optimizationoptimización de políticasByteDancePPO alternate

Abstract

PROBLEMA: La optimización de políticas estándar (como PPO) suele operar a nivel de secuencia completa, lo que dificulta la corrección de errores específicos en pasos intermedios (tokens) que llevan a una respuesta final incorrecta. SOLUCIÓN: Se propone CoRT (Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization), un método que utiliza repetición contrafactual para evaluar y corregir tokens individuales basándose en una rúbrica de grano fino. METODOLOGÍA: El sistema genera trayectorias alternativas ('contrafactuales') en puntos críticos de decisión y utiliza un generador de rúblicas para asignar crédito o penalización a nivel de token, optimizando la política en base a estos hitos internos. RESULTADOS: CoRT muestra una eficiencia de muestra superior y una mayor precisión en tareas de resolución de problemas matemáticos y razonamiento lógico comparado con RLHF tradicional. RELEVANCIA: Clave para reducir el error de arrastre en razonamientos largos y mejorar la precisión factual de los agentes.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies