Nuevo método podría aumentar la eficiencia del entrenamiento de LLMs
Investigadores del MIT han desarrollado TLT (Taming the Long Tail), un método que aprovecha el tiempo de cómputo inactivo durante el entrenamiento de modelos de lenguaje grandes (LLMs) de razonamiento. Entrena un modelo más pequeño para predecir salidas que el modelo principal verifica, duplicando la velocidad de entrenamiento sin perder precisión. Utiliza decodificación especulativa adaptativa para optimizar recursos en procesadores ociosos. Esta técnica reduce costos y consumo energético en el desarrollo de LLMs para aplicaciones como previsión financiera o detección de riesgos en redes eléctricas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.
TLTTaming the Long TailQinghao HuSong Hanmodelos de lenguajeentrenamiento eficienterazonamiento en IA
Leer noticia original