Ir al contenido principalSaltar al contenido
Hugging Face

Cómo usar múltiples GPUs en Hugging Face Transformers: Device Map frente a Paralelismo de Tensores

Este artículo explica dos enfoques para utilizar múltiples GPUs con Hugging Face Transformers: device_map, que realiza un reparto de memoria simple para inferencia en modelos grandes, y paralelismo de tensores (tp_plan), que permite cómputo paralelo real con aceleración. Se describe cómo restringir las GPUs visibles mediante CUDA_VISIBLE_DEVICES, se proporcionan ejemplos de código para ambos métodos y se compara sus ventajas e inconvenientes en una tabla. Device_map es ideal para inferencia sencilla sin necesidad de entrenamiento, mientras que tp_plan ofrece mejoras en velocidad pero requiere configuración distribuida con torchrun.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Hugging Face Transformersmúltiples GPUsdevice_mapparalelismo de tensorestp_planCUDA_VISIBLE_DEVICEStorchrun
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies