Ir al contenido principalSaltar al contenido
Hugging Face

vLLM V0 a V1: La corrección antes de las correcciones en RL

ServiceNow-AI detalla la migración de vLLM V0 a V1 en su framework PipelineRL para generación de rollouts en entrenamiento RL. Priorizaron restaurar la paridad en logprobs y comportamiento del backend antes de ajustar el objetivo RL, corrigiendo semántica de logprobs, configuraciones por defecto como prefix caching y async scheduling, manejo de actualizaciones de pesos en vuelo, y precisión fp32 en lm_head. Tras estas fixes, métricas como KL, clip rate, entropía y reward coinciden con la referencia V0. El enfoque subraya la importancia de corregir el backend primero para interpretaciones claras del entrenamiento.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

vLLMPipelineRLaprendizaje por refuerzologprobsServiceNow-AIinferencialm_head
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies