ChronoVision: razonamiento temporal en LLMs mediante reconstrucción de estado latente | Cómo mejorar la comprensión de orden, duración y causalidad de eventos en modelos de lenguaje | Técnica de prompting y fine-tuning para que una IA razone sobre líneas de tiempo, planifique y entienda secuencias
Abstract
PROBLEMA: Los LLMs cometen errores sistemáticos al razonar sobre secuencias temporales —orden de eventos, duraciones, solapamientos y causalidad en el tiempo— incluso cuando el prompting con chain-of-thought (CoT) es correcto, porque la representación interna del estado del mundo en cada instante es imprecisa o se omite. SOLUCIÓN: ChronoVision propone mejorar el razonamiento temporal mediante reconstrucción de estado latente: antes de emitir la respuesta, el modelo reconstruye explícitamente la evolución de los estados del mundo a lo largo de la línea temporal (estado latente por instante) y condiciona su respuesta a esa reconstrucción, en lugar de razonar directamente sobre el texto. METODOLOGÍA: Diseña un pipeline de razonamiento en dos fases —primero reconstrucción de estados latentes y después generación condicionada— implementado mediante prompting few-shot y ajuste fino; se evalúa en benchmarks de razonamiento temporal (eventos, horarios, narrativas y planificación) comparando con CoT estándar, few-shot y modelos de referencia. RESULTADOS: Mejora consistente en precisión sobre tareas temporales, con reducción de errores de orden y duración, y ventajas en escenarios con múltiples eventos solapados donde el CoT clásico falla. RELEVANCIA: Introduce una conexión explícita entre razonamiento de LLMs y modelos de mundo —el modelo reconstruye estados del mundo—, con aplicaciones directas a agentes que planifican, QA temporal y simulaciones basadas en lenguaje.