Diagnostico y entrenamiento de LLMs para detectar y abortar el razonamiento inutil | Como evitar que los modelos gasten tokens y latencia en cadenas de pensamiento que nunca convergen | Parada temprana de razonamiento esteril para reducir el coste de chain-of-thought en inferencia
Abstract
PROBLEMA: los modelos de razonamiento extendido producen cadenas de pensamiento muy largas, pero una parte importante de esos tokens se invierte en rutas que no progresan: bucles, repeticiones y pasos que no acercan a la respuesta. Ese razonamiento faru vuelve la inferencia cara, lenta y propensa a errores, y no existe un criterio claro para que el modelo reconozca cuando debe detenerse. SOLUCION: este trabajo diagnostica el fenomeno del razonamiento esteril en LLMs, identifica senales observables de estancamiento (repeticiones, incertidumbre que no disminuye, ausencia de progreso) y entrena a los modelos para abortar una trayectoria sin salida cuanto antes, respondiendo con lo que ya han procesado o declarando que no saben. METODOLOGIA: construyen un cj de trayectorias anotadas como productivas o futuras, analizan caracteristicas diagnosticas de los pasos de razonamiento y entrenan tanto con supervision directa sobre el punto de abort como con aprendizaje por refuerzo que premia terminar pronto y correcto y penaliza el computo despertado; evaluan varias escalas de modelos en razonamiento de multiples pasos. RESULTADOS: los analisis revelan que una fraccion muy importante de los tokens generados no contribuye a la mejor, y que tras el entrenamiento los modelos retienen o incluso mejoran su exactitud mientras reducen de forma significativa el numero de tokens emitidos y la latencia; la documente cuando la parada temprana conlleva riesgo de conclusiones precipitadas. RELEVANCIA: es una pieza clave para la eficiencia de inferencia de los razonadores actuales y complementa a CoT, ToT y las tecnicas de recarga en tiempo de prueba: saber cuando parar es tan decisivo como saber que paso seguir, y tambien reduce las respuestas largas e incorrect asadas en razonamientos prolongados.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.