Ir al contenido principalSaltar al contenido
Developer Tech News

Resolviendo la fragmentación del hardware para el rendimiento en aprendizaje profundo

El equipo de Burn ha lanzado la versión 0.20 de su framework de código abierto, que unifica los modelos de ejecución en CPU y GPU para resolver la fragmentación de hardware en el aprendizaje profundo. Esta actualización permite un rendimiento consistente en diversos hardwares sin mantener codebases fragmentados, utilizando CubeCL y el nuevo proyecto CubeK para optimizar kernels dinámicamente. Los benchmarks muestran aceleraciones de hasta 4x en operaciones como max_pool2d en CPU comparado con LibTorch. Además, añade soporte para aceleradores como TMA en arquitecturas NVIDIA Blackwell y mejora las abstracciones de entrenamiento para paradigmas como el aprendizaje por refuerzo. Aunque persisten limitaciones en convoluciones y multiplicación de matrices, esta liberación reduce el cuello de botella para ingenieros de deep learning y potencialmente baja costos de inferencia.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Burnaprendizaje profundofragmentación de hardwareCubeCLCubeKNVIDIA Blackwellcódigo abierto
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies