Sobreentrenamiento extremo en modelos de lenguaje pequeños
Este artículo explora los efectos del sobreentrenamiento extremo en un modelo de lenguaje de aproximadamente 0.9M parámetros, entrenado con una proporción de 222.000 tokens por parámetro. Los resultados muestran que el rendimiento del modelo alcanzó su punto máximo alrededor de los 20 mil millones de tokens (22K:1) y luego se degradó significativamente durante los siguientes 160 mil millones de tokens, indicando un sobreentrenamiento severo. Se concluye que la proporción óptima de tokens por parámetro para modelos pequeños se encuentra en el rango de 22K-30K.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.
sobreentrenamientomodelos de lenguaje pequeñosparámetrostokens por parámetrorendimiento de modelosChinchillaHugging Face
Leer noticia original