Quantization-Aware Healing: un modelo comprimido de 4 bits que supera a su original en precisión completa
Multiverse Computing ha presentado Quantization-Aware Healing (QAH), una técnica que permite recuperar modelos de lenguaje comprimidos y cuantizados a 4 bits hasta el punto de superar a su versión original en precisión completa. Aplicado a un modelo GPT-OSS de 120B comprimido a 60B parámetros y cuantizado a MXFP4, el resultado gana a su propio checkpoint bfloat16 en 7 de los 9 benchmarks evaluados, con las mayores mejoras en razonamiento de contexto largo y matemáticas. A diferencia de métodos habituales como QAT o QAD, QAH destila directamente desde el modelo original previo a la compresión, evitando el techo de rendimiento de los checkpoints recuperados y logrando mayor estabilidad. Además, alcanza su mejor punto unas siete veces más rápido que QAT y sin riesgo de degradación posterior. El resultado es un modelo más pequeño, más barato de ejecutar y más preciso, lo que invierte la relación habitual entre un modelo de 4 bits y su versión de 16 bits.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.