Ir al contenido principalSaltar al contenido
Hugging Face

Diversidad vs. Densidad: Comparación de estrategias de datos para el fine-tuning de VLMs

Akhil Theerthala presenta un estudio comparativo entre dos estrategias de curación de datos para el fine-tuning de modelos de visión-lenguaje (VLMs): la diversidad, que utiliza muchas imágenes con pocas preguntas cada una, y la densidad, que emplea pocas imágenes con múltiples preguntas por imagen. Utilizando el dataset GQA, generó datos sintéticos y entrenó varios modelos Qwen3-VL mediante LoRA, congelando los codificadores de visión. Los resultados indican que la diversidad supera ligeramente a la densidad en pruebas in-domain y out-of-domain como RealWorldQA, aunque la densidad ofrece eficiencia en dominios con datos escasos como robótica o manufactura. Esta aproximación es relevante para optimizar costes y privacidad en el entrenamiento personalizado de VLMs. El autor propone investigaciones futuras a mayor escala y con combinaciones híbridas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

diversidaddensidadVLMsfine-tuningQwen3-VLGQALoRA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies