Introduciendo SPEED-Bench: Un benchmark unificado y diverso para la decodificación especulativa
NVIDIA ha presentado SPEED-Bench, un nuevo benchmark unificado para evaluar la decodificación especulativa (SD) en modelos de lenguaje grandes (LLM), abordando las limitaciones de evaluaciones previas fragmentadas. SPEED-Bench consta de dos divisiones de datos: una 'Qualitativa' para medir la precisión de especulación en diversos dominios semánticos y una 'Throughput' para evaluar aceleraciones en regímenes de servicio realistas con longitudes de secuencia largas y alta concurrencia. Incluye un marco de medición unificado compatible con motores de inferencia de producción como TensorRT-LLM, vLLM y SGLang. El benchmark revela dependencias por dominio en la precisión, problemas con la poda de vocabulario y sobreestimaciones por tokens aleatorios. Está disponible abiertamente junto con su dataset y framework para fomentar evaluaciones rigurosas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.