Ir al contenido principalSaltar al contenido

OasisKV: escalado del caché KV durante inferencia más allá de HBM mediante prefetching disperso con mirada hacia adelante | Cómo acelerar la generación de texto en LLMs de contexto largo sin agotar la memoria | Técnica de gestión de KV cache para reducir latencia en la inferencia de transformers en producción

KV cachecaché de claves y valoresinference optimizationoptimización de inferenciasparse prefetchingprefetching dispersolong contextcontexto largomemory managementgestión de memoriadecoding latency

Abstract

PROBLEMA: los modelos de lenguaje de contexto largo saturan la memoria de alto ancho de banda (HBM) durante la fase de decodificación, pues el caché de key-value (KV) crece con la longitud de la secuencia y limita tanto la velocidad como la longitud práctica del contexto. SOLUCIÓN: presenta OasisKV, un sistema de gestión del KV cache que escala el caché más allá de la memoria HBM mediante prefetching disperso con mirada hacia adelante (lookahead sparse prefetching), anticipando qué datos cargar para minimizar accesos lentos a memoria secundaria. METODOLOGÍA: combina almacenamiento del caché fuera de HBM con un esquema predictivo de prefetching que decide dinámicamente qué componentes cargar por adelantado durante el decodificado, reduciendo la latencia de acceso a memoria. RESULTADOS: reduce sustancialmente la latencia de inferencia y el consumo de memoria frente a sistemas baseline, permitiendo contextos mucho más largos con el hardware disponible sin degradar la calidad de la generación. RELEVANCIA: mejora la inferencia eficiente de LLMs, componente clave para desplegar agentes y sistemas de razonamiento de contexto largo en entornos de producción.

Más info: Política de Cookies