Ir al contenido principalSaltar al contenido
Hugging Face

SmolLM-Smashed: Gigantes diminutos, optimizados para velocidad

La familia SmolLM, conocida por su diseño eficiente (de 135M a 3B parámetros), recibe un impulso adicional con SmolLM-Smashed mediante optimizaciones de Pruna. Se utilizan técnicas de cuantización HQQ a 4 bits y compilación torch.compile para hacer los modelos más pequeños, rápidos y desplegables en hardware modesto sin sacrificar precisión. Se optimizaron variantes como SmolLM2-360M, SmolLM2-1.7B y SmolLM3-3B, logrando reducciones de memoria del 75-80% y aceleraciones de 2-3x. Los modelos están disponibles en una colección de Hugging Face y hay una demo interactiva en Replicate.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

SmolLMSmolLM-SmashedPruna AIcuantización HQQtorch.compileoptimización de modelosmodelos eficientes
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies