Ir al contenido principalSaltar al contenido

Busqueda de haz a nivel de pensamiento para mejorar el razonamiento de LLMs | Como ampliar el razonamiento de un modelo sin reentrenar expandiendo, puntuando y podando cadenas de pensamiento | Decodificacion guiada por busqueda para tareas multi-paso y matematicas con presupuesto de inferencia controlado

beam searchchain-of-thoughttest-time computepensamiento de hacesensamados de pensamientopoda de trayectoriasdecodificacion guiadarazonamiento multi-pasoinference-time optimization

Abstract

PROBLEMA: Los modelos de lenguaje generan razonamiento paso a paso de forma autorregresiva, pero la decodificacion greedy o por muestreo propaga errores de los pasos intermedios: si un pensamiento inicial es erroneo, todo lo que sigue puede malograrse sin ofrecer alternativas de correccion. El beam search convencional, por su parte, opera a nivel de tokens o n-gramas cortos y no capta la estructura global de una cadena de pensamiento completa. SOLUCION: El paper propone un beam search a nivel de pensamiento: mantiene varias cadenas de razonamiento parciales en paralelo, las expande con pasos alternativos, las puntua de forma global y las poda para conservar solo las trayectorias mas prometedoras, tratando el razonamiento como una busqueda en un espacio estructurado de pensamientos y no como una secuencia lineal de tokens. METODOLOGIA: Define formalmente el espacio de estados de razonamiento, funciones de puntuacion de cadenas completas, esquemas de poda con presupuesto de computo configurable y expansiones paralelas de ramas; se evalua en conjuntos de razonamiento matematico y multi-paso con modelos abiertos, comparando con greedy, muestreo y autoverificacion. RESULTADOS: Segun reportan los autores, se obtienen ganancias de exactitud y robustez frente a la variabilidad del muestreo, con una curva de exactitud-presupuesto donde la poda permite ajustar el gasto de tokens segun la dificultad de la consulta; las mejoras mas notorias aparecen cuando el presupuesto de busqueda es limitado. RELEVANCIA: es una tecnica de computo en tiempo de prueba (test-time compute) que no requiere reentrenamiento ni acceso a pesos de alto costo, por lo que se aplica directamente a sistemas de RAG, agentes y razonadores que buscan mas precision sin sacrificar latencia ni costo.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies