Prueba de Tiempo: Un benchmark para evaluar juicios de ideas científicas
Se presenta Proof of Time (PoT), un nuevo marco de benchmarking que evalúa la capacidad de los modelos de IA para juzgar ideas científicas prediciendo resultados futuros observables como conteos de citas, premios de revisión por pares, evoluciones en agendas de investigación y trayectorias de benchmarks SOTA. Utiliza un sandbox offline aislado de red para medir el uso de evidencia congelada pre-cutoff sin fugas de información. Se evalúan modelos frontier de Anthropic, Google y OpenAI en cuatro familias de tareas, demostrando mejoras significativas con cómputo en tiempo de prueba y configuraciones agenticas, especialmente en tareas que requieren agregación de evidencia dispersa. Los resultados resaltan la necesidad de evaluaciones post-cutoff para distinguir razonamiento genuino de memorización y analizan fallos comunes en ejecuciones agenticas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.