Cómo crear un benchmark con un conjunto de pruebas privado en Hugging Face
Esta guía detalla cómo configurar un leaderboard público para benchmarks en Hugging Face utilizando Spaces de Gradio y Datasets. Se compone de un leaderboard que recibe submissions, un dataset de envíos, un evaluador privado que puntúa contra un test set oculto y un dataset de resultados que el leaderboard muestra. El proceso mantiene la privacidad del test set mientras permite a los usuarios enviar predicciones y ver rankings. Incluye ejemplos de código para la implementación en app.py, utils.py y el evaluador, enfatizando la consistencia del esquema de datos y el manejo de tokens HF. Es ideal para organizar desafíos de IA con evaluación automática.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.