Inferencia CPU de alto rendimiento para modelos mixture-of-experts locales con aceleración GPU en llama.cpp
Esta guía explica cómo optimizar llama.cpp para ejecutar modelos grandes de mezcla de expertos (MoE) de forma local, combinando inferencia en CPU con aceleración GPU. Se detalla la asignación de parámetros 'siempre activos' como atención y FFN densos a la GPU, mientras los expertos routados se offloadean a la CPU para maximizar la velocidad de generación de tokens. Incluye comandos detallados, optimizaciones para procesamiento de prompts y configuraciones para múltiples GPUs. Además, cubre características avanzadas de ik_llama.cpp y consideraciones NUMA para sistemas multi-socket, permitiendo rendimiento eficiente en hardware variado.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.