Ir al contenido principalSaltar al contenido
Hugging Face

Brecha de TFLOPS: Por qué la ingeniería de kernels MoE en FP4 importa en Blackwell

Konstantin de apsys ha benchmarkeado tres backends líderes para modelos Mixture of Experts (MoE) con cuantización FP4 en una GPU Blackwell B200: vLLM, SGLang y FlashInfer CuteDSL. SGLang logra el mayor rendimiento con 1262 TFLOPS en batch grande, gracias a fusión de kernels, optimizaciones específicas de Blackwell y dimensionado adaptativo de grillas. Estas mejoras proporcionan aceleraciones de hasta 3,54x sobre BF16 y 1,32x sobre vLLM en inferencia interactiva. El artículo detalla las diferencias en fusión de kernels, programación CUTLASS y manejo de batches pequeños, destacando la importancia de la ingeniería de kernels para explotar el hardware FP4 nativo. Esto es relevante para el futuro de la inferencia en modelos grandes como DeepSeek-V3 con cientos de expertos.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

BlackwellFP4MoESGLangvLLMingeniería de kernelsinferencia
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies