Búsqueda de haz a nivel de pensamiento para mejorar el razonamiento de LLMs | Cómo explorar múltiples cadenas de razonamiento en paralelo sin reentrenar el modelo | Técnica de decodificación que combina beam search y cadenas de pensamiento para respuestas más fiables
Abstract
PROBLEMA: los LLMs razonan mejor cuando exploran varias cadenas de pensamiento, pero el muestreo bruto de trayectorias (best-of-n, self-consistency) es caro e indiscriminado: invierte cómputo en cadenas fallidas y no estructura la búsqueda hacia soluciones consistentes, lo que limita la precisión y encarece la inferencia. SOLUCIÓN: el paper propone thought-level beam search, una técnica de decodificación que aplica búsqueda de haz sobre unidades de razonamiento completas —pensamientos— en lugar de sobre tokens, manteniendo en paralelo las k hipótesis más prometedoras de la cadena de razonamiento. METODOLOGÍA: algoritmo de búsqueda que expande cada estado de razonamiento con nuevos pasos de cadena de pensamiento, puntúa las candidatas, poda las ramas débiles y retrocede cuando una hipótesis se estanca; los experimentos cubren benchmarks de razonamiento matemático y lógico comparando contra CoT estándar, self-consistency y best-of-n. RESULTADOS: los resultados reportados muestran mayor precisión con menor presupuesto de muestreo que best-of-n, porque el cómputo se concentra en trayectorias prometedoras y las ramas sin salida se descartan pronto, reduciendo el coste por respuesta correcta. RELEVANCIA: mejora el razonamiento en tiempo de inferencia sin reentrenar el modelo, por lo que es directamente aplicable a sistemas RAG y agentes que necesitan respuestas razonadas, verificables y con un presupuesto de tokens controlado.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.