Ir al contenido principalSaltar al contenido

Comprensión del razonamiento desde el pre-entrenamiento al post-entrenamiento | Análisis del origen de la lógica en modelos de lenguaje | Cómo optimizar el entrenamiento para mejorar capacidades cognitivas en IA

LLM reasoningpost-training qualitypre-training dynamicsrazonamiento lógico IAcapacidades cognitivas LLMaprendizaje de modelos de lenguajeanálisis de entrenamiento IA

Abstract

PROBLEMA: Existe un debate teórico sobre si la capacidad de razonamiento de los LLMs surge principalmente de la vasta cantidad de datos del pre-entrenamiento o de las técnicas de refinamiento (post-training) como SFT y RLHF. SOLUCIÓN: Este trabajo proporciona un análisis exhaustivo que desglosa cómo las estructuras lógicas se forman inicialmente y cómo el post-training las "desbloquea" o las refina para su uso en aplicaciones prácticas. METODOLOGÍA: Los autores realizaron experimentos controlados variando la mezcla de datos y las técnicas de alineación en modelos de diferentes escalas, monitorizando métricas de razonamiento simbólico y matemático. RESULTADOS: Se descubre que mientras el pre-entrenamiento acumula el "conocimiento latente", el post-training es crítico para la activación de rutas de pensamiento coherentes (Chain of Thought); sin un post-training adecuado, el razonamiento permanece inaccesible. RELEVANCIA: Fundamental para diseñadores de modelos que buscan optimizar los recursos de cómputo dividiendo eficientemente los objetivos entre las fases de entrenamiento.