ParaTempo: razonamiento paralelo eficiente en LLMs mediante confianza temporal | Cómo acelerar la cadena de pensamiento paralelizando pasos de razonamiento según su confianza | Técnica para reducir latencia en tareas de razonamiento multi-paso de modelos de lenguaje en producción
Abstract
PROBLEMA: los LLM modernos dependen de razonamientos de múltiples pasos (chain-of-thought) que, ejecutados de forma secuencial, introducen latencia elevada que limita su despliegue en sistemas interactivos en tiempo real. Acelerar ese razonamiento sin degradar la calidad de la respuesta es un cuello de botella central en la inferencia generativa. SOLUCIÓN: ParaTempo propone un esquema de razonamiento paralelo eficiente que decide dinámicamente, según una señal de confianza temporal estimada durante la generación, qué pasos de un razonamiento pueden lanzarse en paralelo y cuáles deben mantenerse en orden estricto. De esta forma equilibra paralelismo y exactitud de forma adaptativa por instancia. METODOLOGÍA: el método define una métrica de confianza basada en la dinámica de probabilidades de los tokens intermedios, junto con un criterio de agrupación para ejecutar pasos concurrentes. Se evalúa sobre tareas estándar de razonamiento matemático y lógico con LLMs de distinto tamaño, comparando throughput frente a estrategias secuenciales y de paralelismo fijo. RESULTADOS: ParaTempo logra aceleraciones sustanciales en latencia respecto al razonamiento secuencial con pérdida de exactitud mínima o nula, superando también a estrategias de paralelización sin criterio de confianza, y mostrando consistencia entre modelos y familias. RELEVANCIA: aporta un mecanismo de eficiencia de inferencia aplicable a cualquier LLM, directamente útil para reducir costes de despliegue y mejorar la experiencia en agentes y asistentes conversacionales sin sacrificar precisión factual.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.