Mezcla de Expertos (MoEs) en Transformers
Hugging Face ha introducido mejoras significativas en la biblioteca Transformers para soportar modelos Mixture of Experts (MoEs), pasando de arquitecturas densas a dispersas más eficientes. Se han refactorizado la carga de pesos para empaquetar expertos de forma contigua, implementado backends de expertos como grouped_mm y batched_mm, y habilitado paralelismo de expertos para escalar a cientos de miles de millones de parámetros. Además, en colaboración con Unsloth, se acelera el entrenamiento de MoEs hasta 12 veces. Estos avances permiten cargar modelos grandes como Qwen1.5-110B en segundos en lugar de minutos, reduciendo VRAM y mejorando velocidades de inferencia. La tendencia MoE se acelera con lanzamientos recientes como DeepSeek R1 y Qwen 3.5.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.