Ir al contenido principalSaltar al contenido
Hugging Face

PRX Parte 3: Entrenando un modelo de texto a imagen en 24 horas

El equipo de Photoroom combina técnicas arquitectónicas y de entrenamiento de partes anteriores para entrenar un modelo de difusión texto-a-imagen en solo 24 horas con 32 GPUs H200 y un presupuesto de unos 1500 dólares. Utilizan predicción x en espacio de píxeles sin VAE, pérdidas perceptuales LPIPS y DINO, enrutamiento de tokens con TREAD, alineación de representaciones REPA con DINOv3 y el optimizador Muon. Se entrena inicialmente a 512px y luego se afina a 1024px con datasets sintéticos públicos, obteniendo resultados sólidos en calidad y seguimiento de prompts. Han liberado el código en GitHub para que la comunidad lo reproduzca y extienda, destacando los avances en eficiencia del entrenamiento de modelos de difusión.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

PhotoroomPRXtexto a imagenmodelos de difusiónTREADREPAentrenamiento eficiente
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies