Ir al contenido principalSaltar al contenido
MIT News

Un mejor método para planificar tareas visuales complejas

Investigadores del MIT han desarrollado un nuevo enfoque impulsado por IA generativa para planificar tareas visuales a largo plazo, como la navegación de robots, que es aproximadamente el doble de efectivo que algunas técnicas existentes. El sistema utiliza dos modelos de visión-lenguaje: uno percibe el escenario en una imagen y simula acciones para alcanzar un objetivo, mientras que el segundo traduce esas simulaciones en archivos en lenguaje PDDL para software de planificación formal. Este método logra una tasa de éxito promedio del 70% y supera a métodos base con un 30%. Es ideal para entornos reales cambiantes, como ensamblajes multirrobot o navegación en condiciones variables. Los investigadores destacan su capacidad para generalizar a problemas no vistos previamente.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Chuchu FanYilun Haomodelos de visión-lenguajeVLMsPDDLplanificación visualIA generativa
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies