Ir al contenido principalSaltar al contenido
Hugging Face

SmolLM-Smashed: Pequeños gigantes optimizados para la velocidad

Pruna AI presenta SmolLM-Smashed, una versión optimizada de la familia de modelos SmolLM mediante cuantización HQQ a 4 bits y compilación con torch.compile. Estas técnicas logran aceleraciones de 2-3x y reducciones de memoria del 70% aproximadamente, manteniendo la precisión. Los modelos optimizados, como SmolLM2-360M, SmolLM2-1.7B y SmolLM3-3B, son ideales para despliegue en hardware modesto. Se proporcionan scripts, un notebook de Colab y una demo interactiva en Replicate para facilitar su uso.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

SmolLM-SmashedPruna AIcuantización HQQtorch.compileSmolLMoptimización de modelosmodelos eficientes
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies