Ir al contenido principalSaltar al contenido
Hugging Face

Prueba de Tiempo: Un benchmark para evaluar juicios de ideas científicas

Se presenta Proof of Time (PoT), un nuevo marco de benchmarking que evalúa la capacidad de los modelos de IA para juzgar ideas científicas prediciendo resultados futuros observables como conteos de citas, premios de revisión por pares, evoluciones en agendas de investigación y trayectorias de benchmarks SOTA. Utiliza un sandbox offline aislado de red para medir el uso de evidencia congelada pre-cutoff sin fugas de información. Se evalúan modelos frontier de Anthropic, Google y OpenAI en cuatro familias de tareas, demostrando mejoras significativas con cómputo en tiempo de prueba y configuraciones agenticas, especialmente en tareas que requieren agregación de evidencia dispersa. Los resultados resaltan la necesidad de evaluaciones post-cutoff para distinguir razonamiento genuino de memorización y analizan fallos comunes en ejecuciones agenticas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Proof of TimePoTbenchmarkjuicios científicosagentes IAcitassandbox offline
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies