Ir al contenido principalSaltar al contenido

Diagnostico y entrenamiento de LLMs para detectar y abortar el razonamiento inutil | Como evitar que los modelos gasten tokens y latencia en cadenas de pensamiento que nunca convergen | Parada temprana de razonamiento esteril para reducir el coste de chain-of-thought en inferencia

futile reasoningearly stoppingchain-of-thoughtaborto de razonamientoeficiencia de inferencelatencia LLMcontrol de computorazonamiento prolongadotokens de CoT

Abstract

PROBLEMA: los modelos de razonamiento extendido producen cadenas de pensamiento muy largas, pero una parte importante de esos tokens se invierte en rutas que no progresan: bucles, repeticiones y pasos que no acercan a la respuesta. Ese razonamiento faru vuelve la inferencia cara, lenta y propensa a errores, y no existe un criterio claro para que el modelo reconozca cuando debe detenerse. SOLUCION: este trabajo diagnostica el fenomeno del razonamiento esteril en LLMs, identifica senales observables de estancamiento (repeticiones, incertidumbre que no disminuye, ausencia de progreso) y entrena a los modelos para abortar una trayectoria sin salida cuanto antes, respondiendo con lo que ya han procesado o declarando que no saben. METODOLOGIA: construyen un cj de trayectorias anotadas como productivas o futuras, analizan caracteristicas diagnosticas de los pasos de razonamiento y entrenan tanto con supervision directa sobre el punto de abort como con aprendizaje por refuerzo que premia terminar pronto y correcto y penaliza el computo despertado; evaluan varias escalas de modelos en razonamiento de multiples pasos. RESULTADOS: los analisis revelan que una fraccion muy importante de los tokens generados no contribuye a la mejor, y que tras el entrenamiento los modelos retienen o incluso mejoran su exactitud mientras reducen de forma significativa el numero de tokens emitidos y la latencia; la documente cuando la parada temprana conlleva riesgo de conclusiones precipitadas. RELEVANCIA: es una pieza clave para la eficiencia de inferencia de los razonadores actuales y complementa a CoT, ToT y las tecnicas de recarga en tiempo de prueba: saber cuando parar es tan decisivo como saber que paso seguir, y tambien reduce las respuestas largas e incorrect asadas en razonamientos prolongados.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies