TruthTensor: Evaluación de LLM en mercados de predicción bajo deriva y línea base de mercado
Inference Labs presenta TruthTensor, un marco de evaluación para modelos de lenguaje grandes (LLM) que mide la divergencia de instrucciones en mercados de predicción bajo condiciones de deriva ambiental. Se desplegaron ocho modelos frontier como agentes autónomos en Polymarket, siguiendo instrucciones bloqueadas con cuatro algoritmos y estrategias seleccionables. TruthTensor activa evaluaciones en movimientos de precios del 1%, comparando el rendimiento ajustado con baselines de usuarios finetuneados. Los resultados destacan diferencias en la adaptación interna de modelos como Claude-Sonnet-4.5 y Kimi-K2-Thinking, revelando sobre-reacciones o inercia. Esta aproximación evita contaminación por memorización y prueba la fidelidad al razonamiento en entornos dinámicos, superando limitaciones de benchmarks estáticos.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.