Ir al contenido principalSaltar al contenido

Análisis de la forma y estructura de las cadenas de pensamiento en el razonamiento matemático de LLMs | Cómo diagnosticar por qué un modelo de razonamiento falla en matemáticas examinando la estructura interna de su chain-of-thought | Marco para detectar cadenas de pensamiento defectuosas y diseñar estrategias de prompting en modelos de lenguaje

chain-of-thoughtCoTrazonamiento matemáticomath reasoningestructura del razonamientodiagnóstico de LLMsprompting razonado

Abstract

PROBLEMA: El razonamiento mediante cadenas de pensamiento (chain-of-thought, CoT) ha demostrado mejorar notablemente la precisión de los grandes modelos de lenguaje (LLMs) en tareas de razonamiento matemático. Sin embargo, la estructura interna de esas cadenas —su 'forma'— sigue siendo poco comprendida: se sabe poco sobre qué patrones de pasos intermedios conducen a respuestas correctas o erróneas y faltan herramientas para diagnosticar por qué una cadena de pensamiento falla. SOLUCIÓN: El trabajo presenta SHAPE, un marco para caracterizar sistemáticamente la forma de las cadenas de pensamiento generadas al resolver problemas matemáticos, conectando propiedades estructurales del razonamiento paso a paso con la calidad de la respuesta final. METODOLOGÍA: Los autores definen métricas de forma sobre los pasos intermedios, como la extensión de la cadena, la presencia de pasos de verificación, la segmentación y la coherencia entre pasos, y las aplican a modelos de razonamiento evaluados sobre colecciones de problemas matemáticos; comparan cadenas vinculadas a respuestas correctas e incorrectas para identificar qué rasgos estructurales discriminan el éxito del fracaso. RESULTADOS: El análisis revela patrones sistemáticos en la forma del CoT correlacionados con la precisión, indicando que la estructura del razonamiento influye en el resultado más allá del contenido de cada paso; estos hallazgos permiten predecir la calidad del razonamiento antes de la respuesta final y orientan la corrección de cadenas defectuosas. RELEVANCIA: SHAPE aporta instrumentos de diagnóstico para detectar cadenas de pensamiento deficientes, diseñar estrategias de prompting más efectivas y seleccionar datos de entrenamiento, contribuyendo a modelos de lenguaje con razonamiento matemático más fiable, robusto y explicable.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies