Ir al contenido principalSaltar al contenido
Hugging Face

Cómo crear un benchmark con un conjunto de pruebas privado en Hugging Face

Esta guía detalla cómo configurar un leaderboard público para benchmarks en Hugging Face utilizando Spaces de Gradio y Datasets. Se compone de un leaderboard que recibe submissions, un dataset de envíos, un evaluador privado que puntúa contra un test set oculto y un dataset de resultados que el leaderboard muestra. El proceso mantiene la privacidad del test set mientras permite a los usuarios enviar predicciones y ver rankings. Incluye ejemplos de código para la implementación en app.py, utils.py y el evaluador, enfatizando la consistencia del esquema de datos y el manejo de tokens HF. Es ideal para organizar desafíos de IA con evaluación automática.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Hugging FacebenchmarkleaderboardGradioDatasetsevaluador privadoHugging Face Spaces
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies