Brecha de TFLOPS: Por qué la ingeniería de kernels MoE en FP4 importa en Blackwell
Konstantin de apsys ha benchmarkeado tres backends líderes para modelos Mixture of Experts (MoE) con cuantización FP4 en una GPU Blackwell B200: vLLM, SGLang y FlashInfer CuteDSL. SGLang logra el mayor rendimiento con 1262 TFLOPS en batch grande, gracias a fusión de kernels, optimizaciones específicas de Blackwell y dimensionado adaptativo de grillas. Estas mejoras proporcionan aceleraciones de hasta 3,54x sobre BF16 y 1,32x sobre vLLM en inferencia interactiva. El artículo detalla las diferencias en fusión de kernels, programación CUTLASS y manejo de batches pequeños, destacando la importancia de la ingeniería de kernels para explotar el hardware FP4 nativo. Esto es relevante para el futuro de la inferencia en modelos grandes como DeepSeek-V3 con cientos de expertos.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.