NUWA

> NÜWA is a unified multimodal pre-trained model that can generate new or manipulate existing visual data (i.e., images and videos) for 8 visual synthesis tasks (as shown above). ## Text-To-Image (T2I) ![t2i](assets/nuwa/t2i.png) ## SKetch-to-Image (S2I) ![s2i](assets/nuwa/s2i.png) ## Image Completion (I2I) ![i2i](assets/nuwa/i2i.png) ## Text-Guided Image Manipulation (TI2I) ![ti2i](assets/nuwa/ti2i.png) ## Text-to-Video(T2V) ![t2v](assets/nuwa/t2v.gif) ## Video Prediction (V2V) ![v2v](assets/nuwa/v2v.gif) ## Sketch-to-Video (S2V) ![s2v](assets/nuwa/s2v.gif) ## Text-Guided Video Manipulation (TV2V) ![out_final](assets/nuwa/tv2v.gif)