Ir al contenido principalSaltar al contenido
Hugging Face

TruthTensor: Evaluación de LLM en mercados de predicción bajo deriva y línea base de mercado

TruthTensor introduce un marco de evaluación para modelos de lenguaje grandes (LLM) en mercados de predicción bajo condiciones de deriva, midiendo la divergencia de instrucciones: cuán lejos se alejan los modelos de sus algoritmos prescritos ante cambios en el entorno. Se desplegaron ocho modelos frontier como agentes autónomos en Polymarket con instrucciones bloqueadas, obligándolos a elegir estrategias fijas como momentum o mean reversion. La plataforma procesó más de 876.000 decisiones en 30 días, comparando el rendimiento ajustado con el realizado y baselines de finetunes crowd-sourced de más de 600.000 usuarios. Los resultados revelan diferencias filosóficas en la respuesta a la deriva, con Claude-Sonnet-4.5 ajustando agresivamente creencias internas y Kimi-K2-Thinking mostrando inercia. Esta aproximación destaca la importancia de evaluar la adherencia a instrucciones en entornos dinámicos, más allá de la precisión predictiva.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

TruthTensorLLMmercados de predicciónPolymarketdivergencia de instruccionesevaluación de razonamientoInference Labs
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies