Diseño de entrenamiento para modelos de texto a imagen: Lecciones de ablaciones
Photoroom publica la segunda parte de su serie sobre el entrenamiento eficiente de modelos de texto a imagen desde cero para su modelo PRX. Comparten resultados de ablaciones en técnicas como alineación de representaciones (REPA, iREPA), objetivos de entrenamiento (Contrastive Flow Matching, predicción de imagen limpia JiT), enrutamiento y sparsificación de tokens (TREAD, SPRINT), y estrategias de datos (piezas largas, datos sintéticos, SFT con Alchemist). Estas intervenciones mejoran la convergencia, la eficiencia y la calidad de las generaciones. Planean liberar el código completo y realizar un 'speedrun' público de 24 horas para demostrar el potencial de la receta completa.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.