TruthTensor: Evaluación de LLM en mercados de predicción bajo deriva y línea base de mercado
TruthTensor introduce un marco de evaluación para modelos de lenguaje grandes (LLM) en mercados de predicción bajo condiciones de deriva, midiendo la divergencia de instrucciones: cuán lejos se alejan los modelos de sus algoritmos prescritos ante cambios en el entorno. Se desplegaron ocho modelos frontier como agentes autónomos en Polymarket con instrucciones bloqueadas, obligándolos a elegir estrategias fijas como momentum o mean reversion. La plataforma procesó más de 876.000 decisiones en 30 días, comparando el rendimiento ajustado con el realizado y baselines de finetunes crowd-sourced de más de 600.000 usuarios. Los resultados revelan diferencias filosóficas en la respuesta a la deriva, con Claude-Sonnet-4.5 ajustando agresivamente creencias internas y Kimi-K2-Thinking mostrando inercia. Esta aproximación destaca la importancia de evaluar la adherencia a instrucciones en entornos dinámicos, más allá de la precisión predictiva.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.