Transformer diferencial V2
Microsoft ha lanzado Differential Transformer V2 (DIFF V2), una evolución del mecanismo de atención diferencial para modelos de lenguaje grandes. Esta versión duplica el número de cabezas de consulta manteniendo las de clave-valor, lo que permite usar kernels estándar como FlashAttention sin necesidad de kernels personalizados, mejorando la velocidad de decodificación y la intensidad aritmética. Elimina la RMSNorm por cabeza de DIFF V1, reduciendo picos de gradientes e inestabilidades durante el entrenamiento a gran escala. Supera las restricciones del softmax tradicional, permitiendo un rango de RMS del contexto más amplio (0 a √2) y eliminando attention sinks. Experimentos preliminares muestran menor pérdida de modelado de lenguaje, menor magnitud de outliers y mayor estabilidad comparado con Transformers baseline.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.