Mezcla de expertos (MoE) en Transformers
Hugging Face ha actualizado la biblioteca Transformers para dar soporte completo a modelos de Mezcla de Expertos (MoE), mejorando la eficiencia en carga, inferencia y entrenamiento. Se introduce un refactor en la carga de pesos que permite packing dinámico de expertos y cuantización integrada, reduciendo tiempos de carga hasta 6 veces en modelos como Qwen1.5-110B. Nuevos backends de expertos y paralelismo de expertos optimizan el enrutamiento y ejecución en hardware distribuido. En colaboración con Unsloth, el entrenamiento de MoE es hasta 12 veces más rápido con menor consumo de VRAM. Estas mejoras posicionan a Transformers como la herramienta líder para arquitecturas sparse en IA abierta.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.