Ir al contenido principalSaltar al contenido
Hugging Face

Sanación con conciencia de cuantización: un modelo de 4 bits que supera a su original de precisión completa

Multiverse Computing presenta Quantization-Aware Healing (QAH), una técnica que permite que modelos de lenguaje comprimidos y cuantizados a 4 bits superen a sus versiones de precisión completa. La metodología se aplica a un modelo GPT-OSS 120B comprimido a 60B parámetros y cuantizado a MXFP4, logrando mejores resultados en 7 de 9 benchmarks comparativos. A diferencia de los métodos tradicionales como la entrenamiento con conciencia de cuantización (QAT) o la destilación con conciencia de cuantización (QAD), QAH distila directamente desde el modelo original pre-compresión, evitando el techo de rendimiento de los checkpoints recuperados. Además, el método es más estable y alcanza su punto óptimo en aproximadamente 100 pasos, mientras que QAT requiere 700 pasos y sufre colapsos posteriores. Los resultados muestran que un modelo de 4 bits puede ser simultáneamente más pequeño, más barato de ejecutar y más preciso que su contraparte de 16 bits.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Quantization-Aware Healingcuantizaciónmodelos de lenguajecompresión de modelosGPT-OSSMXFP4eficiencia en IA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies