Ir al contenido principalSaltar al contenido
Hugging Face Blog

Backend de modelado de transformadores vLLM a velocidad nativa

El backend de transformadores vLLM ahora es tan rápido (o más rápido) que las implementaciones personalizadas de vLLM para muchas arquitecturas de LLM. Esto permite a los autores de modelos aprovechar automáticamente sus implementaciones de transformadores para obtener una inferencia vLLM ultrarrápida de forma gratuita. Este avance integra eficientemente los modelos de Transformers dentro de vLLM, usando técnicas optimizadas como el batching continuo y kernels de atención personalizados. Las actualizaciones dinámicas en tiempo de ejecución, que incluyen fusiones de capas y optimizaciones con `torch.fx`, aseguran que el rendimiento sea comparable al de las implementaciones nativas específicas de vLLM, facilitando el despliegue con una sola bandera sin modificar la configuración de paralelismo existente.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

vLLMTransformersinferencia de LLMmodelos de lenguajeoptimizacióntorch.fxHugging Face
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies