SmolLM-Smashed: Pequeños gigantes optimizados para la velocidad
Pruna AI presenta SmolLM-Smashed, una versión optimizada de la familia de modelos SmolLM mediante cuantización HQQ a 4 bits y compilación con torch.compile. Estas técnicas logran aceleraciones de 2-3x y reducciones de memoria del 70% aproximadamente, manteniendo la precisión. Los modelos optimizados, como SmolLM2-360M, SmolLM2-1.7B y SmolLM3-3B, son ideales para despliegue en hardware modesto. Se proporcionan scripts, un notebook de Colab y una demo interactiva en Replicate para facilitar su uso.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.
SmolLM-SmashedPruna AIcuantización HQQtorch.compileSmolLMoptimización de modelosmodelos eficientes
Leer noticia original