Ir al contenido principalSaltar al contenido
Hugging Face

Transformer diferencial V2

Microsoft ha lanzado Differential Transformer V2 (DIFF V2), una evolución del mecanismo de atención diferencial para modelos de lenguaje grandes. Esta versión duplica el número de cabezas de consulta manteniendo las de clave-valor, lo que permite usar kernels estándar como FlashAttention sin necesidad de kernels personalizados, mejorando la velocidad de decodificación y la intensidad aritmética. Elimina la RMSNorm por cabeza de DIFF V1, reduciendo picos de gradientes e inestabilidades durante el entrenamiento a gran escala. Supera las restricciones del softmax tradicional, permitiendo un rango de RMS del contexto más amplio (0 a √2) y eliminando attention sinks. Experimentos preliminares muestran menor pérdida de modelado de lenguaje, menor magnitud de outliers y mayor estabilidad comparado con Transformers baseline.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Differential Transformer V2DIFF V2Microsoftatención diferencialFlashAttentionGQALLM
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies