Busqueda de haz a nivel de pensamiento para mejorar el razonamiento de LLMs | Como ampliar el razonamiento de un modelo sin reentrenar expandiendo, puntuando y podando cadenas de pensamiento | Decodificacion guiada por busqueda para tareas multi-paso y matematicas con presupuesto de inferencia controlado
Abstract
PROBLEMA: Los modelos de lenguaje generan razonamiento paso a paso de forma autorregresiva, pero la decodificacion greedy o por muestreo propaga errores de los pasos intermedios: si un pensamiento inicial es erroneo, todo lo que sigue puede malograrse sin ofrecer alternativas de correccion. El beam search convencional, por su parte, opera a nivel de tokens o n-gramas cortos y no capta la estructura global de una cadena de pensamiento completa. SOLUCION: El paper propone un beam search a nivel de pensamiento: mantiene varias cadenas de razonamiento parciales en paralelo, las expande con pasos alternativos, las puntua de forma global y las poda para conservar solo las trayectorias mas prometedoras, tratando el razonamiento como una busqueda en un espacio estructurado de pensamientos y no como una secuencia lineal de tokens. METODOLOGIA: Define formalmente el espacio de estados de razonamiento, funciones de puntuacion de cadenas completas, esquemas de poda con presupuesto de computo configurable y expansiones paralelas de ramas; se evalua en conjuntos de razonamiento matematico y multi-paso con modelos abiertos, comparando con greedy, muestreo y autoverificacion. RESULTADOS: Segun reportan los autores, se obtienen ganancias de exactitud y robustez frente a la variabilidad del muestreo, con una curva de exactitud-presupuesto donde la poda permite ajustar el gasto de tokens segun la dificultad de la consulta; las mejoras mas notorias aparecen cuando el presupuesto de busqueda es limitado. RELEVANCIA: es una tecnica de computo en tiempo de prueba (test-time compute) que no requiere reentrenamiento ni acceso a pesos de alto costo, por lo que se aplica directamente a sistemas de RAG, agentes y razonadores que buscan mas precision sin sacrificar latencia ni costo.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.