El desafío Fast Gemma: nuestra receta SOTA verificada al completo
El equipo de VIDRAFT, compitiendo como `vidraft-darwin`, comparte su configuración completa para el desafío Fast Gemma, un concurso de optimización de inferencia de modelos de lenguaje en hardware idéntico. Han logrado 510.58 TPS con una PPL de 2.3930, siendo la velocidad más alta verificada sin sacrificar calidad. La publicación detalla las optimizaciones de software utilizadas, como la ventana deslizante, el "centroid top-k" y un puente de calentamiento sintético, destacando la importancia de la colaboración comunitaria en el desarrollo de sus logros. Su objetivo es inspirar a otros a portar estas optimizaciones a diferentes GPU.
Fast Gemma ChallengeVIDRAFTGemmaoptimización de inferenciamodelos de lenguajeHugging FaceGPU NVIDIA A10G
Leer noticia original