Cómo usar múltiples GPUs en Hugging Face Transformers: Device Map frente a Paralelismo de Tensores
Este artículo explica dos enfoques para utilizar múltiples GPUs con Hugging Face Transformers: device_map, que realiza un reparto de memoria simple para inferencia en modelos grandes, y paralelismo de tensores (tp_plan), que permite cómputo paralelo real con aceleración. Se describe cómo restringir las GPUs visibles mediante CUDA_VISIBLE_DEVICES, se proporcionan ejemplos de código para ambos métodos y se compara sus ventajas e inconvenientes en una tabla. Device_map es ideal para inferencia sencilla sin necesidad de entrenamiento, mientras que tp_plan ofrece mejoras en velocidad pero requiere configuración distribuida con torchrun.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.