Hace un par de semanas me propuse un proyecto loco: entrenar un modelo GAN (DCGAN) para generar memes de gatos con texto. La idea era usar un dataset de ~10k memes de gatos (imágenes + texto extraído con OCR). Spoiler: los resultados son horribles, pero aprendí muchísimo sobre estabilidad de GANs, preprocesamiento y cuándo es mejor rendirse (por ahora).
Les comparto el repo (aún en desarrollo): github.com/anon/gato-meme-gan. El modelo genera imágenes de 64x64 que parecen manchas borrosas con orejas, y el texto es ilegible. Usé torch con WGAN-GP para estabilizar, pero aún colapsa en modo ruido. ¿Alguien ha logrado generar texto coherente en imágenes con GANs? ¿O debería probar con VQ-VAE + transformers?