Beam search a nivel de pensamiento para razonamiento en LLMs | Cómo acelerar y mejorar la búsqueda de cadenas de razonamiento en modelos de lenguaje | Técnica de decodificación para resolver problemas de razonamiento multi-paso sin reentrenar
Abstract
PROBLEMA: los modelos de lenguaje razonan de forma autorregresiva paso a paso, y las estrategias de decodificación convencionales (greedy o muestreo simple) exploran de manera limitada el espacio de posibles cadenas de pensamiento, desperdiciando cómputo y fallando en problemas de razonamiento multi-paso. SOLUCIÓN: el paper introduce 'Thought-Level Beam Search', una técnica de decodificación que aplica búsqueda en haz sobre pensamientos completos (unidades de razonamiento autocontenidas) en lugar de sobre tokens individuales, permitiendo explorar varias rutas de razonamiento en paralelo y seleccionar la más prometedora. METODOLOGÍA: la propuesta segmenta el razonamiento en pasos de pensamiento y mantiene un haz de hipótesis candidatas evaluadas con un mecanismo de puntuación; se combina con la arquitectura del LLM para generar y podar cadenas en paralelo en tiempo de inferencia, sin modificar los pesos del modelo. RESULTADOS: el enfoque reporta mejoras en precisión sobre tareas de razonamiento aritmético, lógico y de sentido común respecto a decodificación estándar, con un coste computacional controlado en comparación con búsquedas exhaustivas. RELEVANCIA: es un avance directo en razonamiento de LLMs (Block 1): ofrece una vía para mejorar capacidades de CoT en inferencia sin reentrenar, con aplicación inmediata a sistemas agénticos y de razonamiento multi-paso en producción.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.