Ir al contenido principalSaltar al contenido
Hugging Face

Code Concepts: Un dataset sintético a gran escala generado desde semillas de conceptos de programación

NVIDIA presenta Code Concepts, un dataset sintético de 15 millones de problemas de programación en Python generado mediante un workflow dirigido por conceptos de programación. Este enfoque utiliza una taxonomía curada de miles de conceptos para crear datos alineados con habilidades específicas como las evaluadas en HumanEval. Al incorporar 10 mil millones de tokens de este dataset en el preentrenamiento final de Nemotron-Nano-v3, se logra una mejora de 6 puntos en el benchmark HumanEval, de 73 a 79, sin afectar otros benchmarks. El dataset y la taxonomía se liberan bajo licencia CC-BY-4.0 para fomentar su uso en el preentrenamiento de LLMs.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Code Conceptsdataset sintéticoNVIDIANemotron-Nano-v3HumanEvalprogramación Pythonconceptos de programación
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies