Code Concepts: Un dataset sintético a gran escala generado desde semillas de conceptos de programación
NVIDIA presenta Code Concepts, un dataset sintético de 15 millones de problemas de programación en Python generado mediante un workflow dirigido por conceptos de programación. Este enfoque utiliza una taxonomía curada de miles de conceptos para crear datos alineados con habilidades específicas como las evaluadas en HumanEval. Al incorporar 10 mil millones de tokens de este dataset en el preentrenamiento final de Nemotron-Nano-v3, se logra una mejora de 6 puntos en el benchmark HumanEval, de 73 a 79, sin afectar otros benchmarks. El dataset y la taxonomía se liberan bajo licencia CC-BY-4.0 para fomentar su uso en el preentrenamiento de LLMs.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.