DumpsterCluster: inferencia de LLaMA-70B agrupando GPUs de bajo coste | Cómo servir modelos de lenguaje grandes sin hardware de gama alta | Sistema de despliegue distribuido que democratiza la ejecución de LLMs de 70B con GPUs de alrededor de 60 dólares
Abstract
PROBLEMA: servir modelos de lenguaje grandes como LLaMA-70B exige GPUs de gama alta (A100/H100) cuyo coste es prohibitivo para laboratorios pequeños, startups e investigadores individuales, lo que concentra el despliegue de IA en quienes pueden pagar hardware caro. SOLUCIÓN: DumpsterCluster propone un sistema que agrupa GPUs de bajo coste —incluidas tarjetas de segunda mano y hardware descartado por centros de datos (lo que denominan 'dumpster diving')— para servir modelos de 70B de forma práctica, demostrando que un clúster de GPUs de aproximadamente 60 dólares cada una puede ejecutar inferencia competitiva. METODOLOGÍA: el sistema combina particionado de capas (tensor/pipeline parallelism) adaptado a GPUs heterogéneas y con poca memoria, cuantización de pesos para ajustar cada capa a los recursos disponibles, y estrategias de comunicación optimizadas que minimizan el cuello de botella de PCIe y red en hardware barato; se evalúa con LLaMA-70B en tareas de generación y razonamiento. RESULTADOS: el trabajo reporta latencias y throughput viables para uso interactivo con una fracción mínima del coste de un servidor convencional, y documenta los fallos y soluciones prácticas al ensamblar hardware no uniforme: desajustes de memoria, throttling térmico y problemas de fiabilidad. RELEVANCIA: democratiza la inferencia de LLMs de gran escala, habilita clústeres de bajo coste para despliegues distribuidos y aporta técnicas directamente aplicables a sistemas de inferencia eficiente y pipelines RAG económicos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.