Haciendo que la destilación de conocimiento sea lo suficientemente económica para ejecutarse a escala
La destilación de conocimiento, una técnica clave para entrenar modelos estudiantiles más pequeños que replican el rendimiento de modelos grandes, se ha vuelto a popularizar con la aparición de grandes modelos de lenguaje de código abierto. Sin embargo, el proceso de destilación es costoso en términos de memoria VRAM y computación. Este artículo presenta dos cambios de sistema para reducir drásticamente estos costos: la destilación offline, que cachea los logits principales del modelo profesor para evitar tenerlo en memoria, y una nueva pérdida KL fusionada y segmentada que procesa los datos en bloques, evitando construir matrices gigantes. Estas innovaciones permiten realizar la destilación en contextos largos con una sola GPU, haciendo que la experimentación a gran escala sea práctica y económica.