Entrenamiento de agentes de búsqueda de largo horizonte mediante asignación de crédito por retroceso de respuesta | Cómo asignar recompensas a acciones intermedias en tareas de búsqueda multi-paso con trayectorias largas | Técnica de credit assignment para mejorar el razonamiento exploratorio de agentes LLM en problemas complejos
Abstract
PROBLEMA: Entrenar agentes de búsqueda que deben explorar trayectorias muy largas (long-horizon) sufre de un problema de asignación de crédito: cuando el agente finalmente encuentra la respuesta correcta, es difícil saber qué acciones intermedias contribuyeron realmente al éxito, porque la señal de recompensa es dispersa y llega al final. SOLUCIÓN: El paper propone ABSeeker, un método que asigna crédito retrocediendo desde la respuesta correcta (answer-backtracking), de modo que las acciones que llevaron a pasos correctos y verificables reciben mayor señal de aprendizaje, mientras que las exploraciones erróneas se devalúan. METODOLOGÍA: Combina un procedimiento de retroceso que reconstruye qué acciones en la trayectoria fueron necesarias para producir la respuesta, con una asignación de crédito por pasos basada en verificaciones parciales; se entrena sobre simulaciones de búsqueda en problemas de razonamiento y herramientas externas. RESULTADOS: Mejora sustancialmente la tasa de éxito y la eficiencia de muestreo de agentes de búsqueda en comparación con el aprendizaje por refuerzo convencional y la destilación directa, logrando trayectorias más cortas y soluciones más robustas en tareas de largo horizonte. RELEVANCIA: aporta un mecanismo general de credit assignment que beneficia a LLMs razonadores y sistemas agénticos con tool use, donde la señal de recompensa dispersa es el principal cuello de botella para el entrenamiento eficiente.