Ir al contenido principalSaltar al contenido
Developer Tech News

Resolviendo la fragmentación de hardware para el rendimiento en aprendizaje profundo

El equipo de Burn ha lanzado la versión 0.20 de su framework de aprendizaje profundo, que unifica los modelos de ejecución en CPU y GPU para eliminar la fragmentación de hardware. Esta actualización refactoriza el backend CubeCL para soportar tipos de datos dinámicos y compilar kernels óptimos automáticamente, mejorando la velocidad de inferencia en hardware commodity. Incluye optimizaciones para CPUs como alineación de caché y coalescencia de memoria, logrando hasta 4x de speedup en operaciones como max_pool2d. Además, añade soporte para arquitecturas NVIDIA Blackwell y mejora la extensibilidad para paradigmas de aprendizaje. Aunque aún no optimizado completamente para convoluciones y multiplicación de matrices, representa un avance significativo hacia un rendimiento consistente sin código fragmentado.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Burnaprendizaje profundofragmentación de hardwareCubeCLCPUGPUcódigo abierto
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies