Nuevo método podría aumentar la eficiencia en el entrenamiento de LLM
Investigadores del MIT han desarrollado un nuevo método denominado TLT (Taming the Long Tail) que aprovecha el tiempo de inactividad de los procesadores para acelerar el entrenamiento de modelos de lenguaje grandes de razonamiento (LLM). Este sistema entrena adaptativamente un modelo más pequeño que predice las salidas del modelo principal, duplicando la velocidad de entrenamiento sin pérdida de precisión. Los autores principales son Qinghao Hu, Shang Yang y Song Han. El método es relevante porque reduce los costes computacionales y energéticos en el desarrollo de IA avanzada para tareas complejas como programación y planificación.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.