Ir al contenido principalSaltar al contenido
Hugging Face

Sanación consciente de la cuantización: un modelo comprimido de 4 bits que supera a su original de precisión completa

Multiverse Computing presenta Quantization-Aware Healing (QAH), una técnica de recuperación para modelos de lenguaje comprimidos y cuantizados a 4 bits. A diferencia de los métodos tradicionales, QAH destila directamente desde el modelo original previo a la compresión en lugar de hacerlo desde un checkpoint ya recuperado, eliminando así el techo de precisión. Aplicado a un GPT-OSS de 120B parámetros comprimido a 60B y cuantizado a MXFP4, el modelo resultante supera a su propia versión bfloat16 en 7 de 9 benchmarks. QAH además es más rápido y estable que el entrenamiento consciente de la cuantización (QAT), alcanzando su pico en menos pasos y sin colapsar. La técnica permite que un modelo de 4 bits sea más pequeño, más barato de servir y más preciso a la vez, invirtiendo la relación habitual entre un modelo cuantizado y su fuente de 16 bits.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

cuantizaciónsanación consciente de la cuantizacióncompresión de modelosdestilaciónGPT-OSSmodelos de lenguajeeficiencia en IA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies