Transferencia escalable de hiperparámetros eficiente en cómputo para Mixture-of-Experts a gran escala | Cómo ajustar hiperparámetros de modelos MoE grandes a partir de experimentos pequeños sin gasto computacional excesivo | Método para escalar el entrenamiento de arquitecturas de mezcla de expertos optimizando el presupuesto de cómputo
Abstract
PROBLEMA: en modelos grandes de Mixture-of-Experts (MoE), la búsqueda de hiperparámetros requiere recursos computacionales enormes, y las recetas de entrenamiento no se transfieren bien entre escalas, haciendo costoso encontrar configuraciones óptimas en despliegues masivos. SOLUCIÓN: el trabajo propone un marco de transferencia de hiperparámetros escalado por cómputo (compute-efficient) para modelos MoE de gran tamaño, diseñado para trasladar configuraciones óptimas desde run de pequeño presupuesto a modelos a gran escala minimizando la pérdida de rendimiento por presupuesto de entrenamiento. METODOLOGÍA: se derivan relaciones de scaling entre tamaño de modelo, presupuesto de tokens y número/activación de expertas, y se introduce una estrategia de extrapolación escalonada que ajusta la tasa de aprendizaje y el coeficiente de regularización por expertos a medida que crece la densidad de parámetros, validada experimentalmente con varias familias de modelos MoE frente a baselines de factorización y barridos completos. RESULTADOS: el método trasfiere hiperparámetros con pérdidas de rendimiento significativamente menores que los enfoques convencionales, logrando acceder a rendimientos comparables a barridos completos pero con una fracción del coste de cómputo, con ganancias consistentes en múltiples y sizes. RELEVANCIA: ofrece una receta reutilizable para reducir drásticamente el presupuesto del entrenamiento de LLMs MoE y otros arquitecturas de expertos, hacer más asequible la experimentación y mejorar el control de calidad en el preentrenamiento de grandes modelos densos y esparseos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.