SmolLM-Smashed: Gigantes diminutos, optimizados para velocidad
La familia SmolLM, conocida por su diseño eficiente (de 135M a 3B parámetros), recibe un impulso adicional con SmolLM-Smashed mediante optimizaciones de Pruna. Se utilizan técnicas de cuantización HQQ a 4 bits y compilación torch.compile para hacer los modelos más pequeños, rápidos y desplegables en hardware modesto sin sacrificar precisión. Se optimizaron variantes como SmolLM2-360M, SmolLM2-1.7B y SmolLM3-3B, logrando reducciones de memoria del 75-80% y aceleraciones de 2-3x. Los modelos están disponibles en una colección de Hugging Face y hay una demo interactiva en Replicate.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.
SmolLMSmolLM-SmashedPruna AIcuantización HQQtorch.compileoptimización de modelosmodelos eficientes
Leer noticia original