Ir al contenido principalSaltar al contenido

Transferencia escalable de hiperparámetros eficiente en cómputo para Mixture-of-Experts a gran escala | Cómo ajustar hiperparámetros de modelos MoE grandes a partir de experimentos pequeños sin gasto computacional excesivo | Método para escalar el entrenamiento de arquitecturas de mezcla de expertos optimizando el presupuesto de cómputo

Mixture-of-Expertshyperparameter transferscaling lawasescalado de modelostasa de aprendizajeeficiencia computacionaltransfer learningentrenamiento MoE

Abstract

PROBLEMA: en modelos grandes de Mixture-of-Experts (MoE), la búsqueda de hiperparámetros requiere recursos computacionales enormes, y las recetas de entrenamiento no se transfieren bien entre escalas, haciendo costoso encontrar configuraciones óptimas en despliegues masivos. SOLUCIÓN: el trabajo propone un marco de transferencia de hiperparámetros escalado por cómputo (compute-efficient) para modelos MoE de gran tamaño, diseñado para trasladar configuraciones óptimas desde run de pequeño presupuesto a modelos a gran escala minimizando la pérdida de rendimiento por presupuesto de entrenamiento. METODOLOGÍA: se derivan relaciones de scaling entre tamaño de modelo, presupuesto de tokens y número/activación de expertas, y se introduce una estrategia de extrapolación escalonada que ajusta la tasa de aprendizaje y el coeficiente de regularización por expertos a medida que crece la densidad de parámetros, validada experimentalmente con varias familias de modelos MoE frente a baselines de factorización y barridos completos. RESULTADOS: el método trasfiere hiperparámetros con pérdidas de rendimiento significativamente menores que los enfoques convencionales, logrando acceder a rendimientos comparables a barridos completos pero con una fracción del coste de cómputo, con ganancias consistentes en múltiples y sizes. RELEVANCIA: ofrece una receta reutilizable para reducir drásticamente el presupuesto del entrenamiento de LLMs MoE y otros arquitecturas de expertos, hacer más asequible la experimentación y mejorar el control de calidad en el preentrenamiento de grandes modelos densos y esparseos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies