TRL v1.0: Biblioteca de post-entrenamiento diseñada para adaptarse al campo
Hugging Face ha lanzado TRL v1.0, una biblioteca de post-entrenamiento que ha evolucionado de un código de investigación a una herramienta estable para sistemas de producción. Cubre más de 75 métodos de post-entrenamiento y adopta un diseño adaptativo al caos para manejar los cambios rápidos en el campo de la IA. Incluye entrenadores estables como SFT, DPO, GRPO y experimentales para innovaciones recientes. Esta versión marca un compromiso con la estabilidad semántica mientras permite la experimentación. TRL se integra profundamente con el ecosistema Hugging Face y se descarga 3 millones de veces al mes.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.
TRLv1.0post-entrenamientoHugging FaceGRPODPORLHF
Leer noticia original