Llevando el aprendizaje por refuerzo de conducción autónoma a OpenEnv y TRL
Sergio Paniego ha portado el simulador de conducción autónoma CARLA al framework OpenEnv, integrándolo con TRL para entrenar LLMs y VLMs mediante aprendizaje por refuerzo. Se añadieron soporte para visión con cámaras, navegación libre en ciudad con tráfico y recompensas basadas en rúbricas. Incluye escenarios como problemas del tranvía y laberintos urbanos para evaluar decisiones éticas y de navegación. Demuestran el entrenamiento de un modelo Qwen que aprende a evitar peatones desviándose de carril. Esto permite entrenamientos accesibles en HF Spaces sin GPU local, democratizando la investigación en IA para conducción autónoma.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.