Transferencia eficiente en cómputo de hiperparámetros para Mixture-of-Experts a gran escala | Cómo escalar modelos MoE sin repetir costosos barridos de hiperparámetros | Método para estimar en modelos pequeños los mejores hiperparámetros de entrenamiento de MoE grandes
Abstract
PROBLEMA: Los modelos Mixture-of-Experts (MoE) de gran escala requieren barridos de hiperparámetros muy costosos, ya que cada configuración implica entrenar a escala enorme, lo que encarece enormemente la búsqueda de configuración óptima. SOLUCIÓN: El paper propone un protocolo de transferencia de hiperparámetros viable en cómputo que escala progresivamente los estudios desde modelos pequeños hacia MoE grandes, reduciendo drásticamente el costo de optimización. METODOLOGÍA: Se estudia la relación entre el costo computacional y la sensibilidad de los hiperparámetros en arquitecturas MoE, identificando cuáles son transferibles entre escalas y diseñando un enfoque de varios pasos que reutiliza configuraciones ya validadas a menor costo antes de confirmarlas a gran escala. RESULTADOS: El método demuestra ahorros de cómputo sustanciales al encontrar configuraciones cercanas al óptimo sin ejecutar barridos completos a escala máxima, validando la transferencia de hiperparámetros como estrategia práctica. RELEVANCIA: Es directamente aplicable al entrenamiento eficiente de LLMs tipo MoE, un pilar de la inferencia escalable, reduciendo el costo económico de desarrollo de modelos de lenguaje grandes.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.