Ir al contenido principalSaltar al contenido
Hugging Face

Quantization-Aware Healing: un modelo comprimido de 4 bits que supera a su original de precisión completa

Multiverse Computing introduce Quantization-Aware Healing (QAH), una nueva técnica para recuperar modelos de lenguaje grandes comprimidos y quantizados. Al aplicar QAH a un modelo GPT-OSS 120B reducido a 60B parámetros y quantizado a MXFP4 de 4 bits, el resultado supera en 7 de 9 benchmarks al checkpoint bfloat16 de la arquitectura original. La clave es distilar directamente del modelo pre-compresión completo como profesor, en lugar del checkpoint recuperado. Esta técnica alcanza su mejor punto 7 veces más rápido que los métodos tradicionales y mantiene la estabilidad del rendimiento, evitando la degradación típica del entrenamiento con QAT. El modelo 4-bit resultante es más pequeño, más barato de ejecutar y más preciso que su versión de 16 bits.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Quantization-Aware Healingmodelos de lenguajeGPT-OSSdistilaciónMXFP4Multiverse ComputingIA de código abierto
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies