Diversidad vs. Densidad: Comparación de estrategias de datos para el fine-tuning de VLMs
Akhil Theerthala presenta un estudio comparativo entre dos estrategias de curación de datos para el fine-tuning de modelos de visión-lenguaje (VLMs): la diversidad, que utiliza muchas imágenes con pocas preguntas cada una, y la densidad, que emplea pocas imágenes con múltiples preguntas por imagen. Utilizando el dataset GQA, generó datos sintéticos y entrenó varios modelos Qwen3-VL mediante LoRA, congelando los codificadores de visión. Los resultados indican que la diversidad supera ligeramente a la densidad en pruebas in-domain y out-of-domain como RealWorldQA, aunque la densidad ofrece eficiencia en dominios con datos escasos como robótica o manufactura. Esta aproximación es relevante para optimizar costes y privacidad en el entrenamiento personalizado de VLMs. El autor propone investigaciones futuras a mayor escala y con combinaciones híbridas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.