Ir al contenido principalSaltar al contenido

Entrenamiento de agentes de búsqueda de largo horizonte mediante asignación de crédito por retroceso de respuesta | Cómo asignar recompensas a acciones intermedias en tareas de búsqueda multi-paso con trayectorias largas | Técnica de credit assignment para mejorar el razonamiento exploratorio de agentes LLM en problemas complejos

credit assignmentreinforcement learningsearch agentsasignación de créditoagentes de búsquedalearning from trajectoriesreward sparsityrazonamiento de largo horizonte

Abstract

PROBLEMA: Entrenar agentes de búsqueda que deben explorar trayectorias muy largas (long-horizon) sufre de un problema de asignación de crédito: cuando el agente finalmente encuentra la respuesta correcta, es difícil saber qué acciones intermedias contribuyeron realmente al éxito, porque la señal de recompensa es dispersa y llega al final. SOLUCIÓN: El paper propone ABSeeker, un método que asigna crédito retrocediendo desde la respuesta correcta (answer-backtracking), de modo que las acciones que llevaron a pasos correctos y verificables reciben mayor señal de aprendizaje, mientras que las exploraciones erróneas se devalúan. METODOLOGÍA: Combina un procedimiento de retroceso que reconstruye qué acciones en la trayectoria fueron necesarias para producir la respuesta, con una asignación de crédito por pasos basada en verificaciones parciales; se entrena sobre simulaciones de búsqueda en problemas de razonamiento y herramientas externas. RESULTADOS: Mejora sustancialmente la tasa de éxito y la eficiencia de muestreo de agentes de búsqueda en comparación con el aprendizaje por refuerzo convencional y la destilación directa, logrando trayectorias más cortas y soluciones más robustas en tareas de largo horizonte. RELEVANCIA: aporta un mecanismo general de credit assignment que beneficia a LLMs razonadores y sistemas agénticos con tool use, donde la señal de recompensa dispersa es el principal cuello de botella para el entrenamiento eficiente.

Más info: Política de Cookies