SynthVision: Creación de un conjunto de datos sintético de 110K para VQA médica con validación cruzada entre modelos
OpenMed, en colaboración con Hugging Face y Doubleword, ha desarrollado SynthVision, un dataset sintético de 110.000 registros para Visual Question Answering (VQA) médica. Se generaron anotaciones de 119.000 imágenes médicas utilizando dos modelos VLMs frontier: Qwen 3.5 y Kimi K2.5, con una validación cruzada que alcanzó un 93% de acuerdo para filtrar alucinaciones. Este dataset permitió fine-tunear modelos pequeños de 2-3B parámetros, logrando mejoras promedio de hasta +15% en benchmarks como VQA-RAD, PathVQA y SLAKE. Todo el pipeline, incluyendo datasets, adaptadores LoRA y código, se ha open-sourceado en Hugging Face, con un coste total inferior a 500 dólares.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.