Generative Models
ver. 1.0.0
Core modern generative modeling: VAEs and diffusion models, plus CLIP and guidance techniques for high-quality, controllable image generation
A compact overview of contemporary generative modeling: variational autoencoders (VAEs) for latent‑variable learning and practical issues; diffusion models that learn a learned reverse denoising chain with ELBO/noise‑prediction losses, accelerated sampling, and conditioning; CLIP’s web‑scale contrastive image–text embeddings and zero‑shot use; and guidance methods (classifier guidance and classifier‑free/CLIP guidance) to trade diversity for fidelity, enable text‑conditioning, inpainting, and cascaded super‑resolution, together with evaluation metrics, common failure modes, and deployment/safety considerations.
This unit synthesizes key modern generative techniques and their practical application to image generation and conditional synthesis.
- Variational Autoencoders (VAEs)
- Latent‑variable modeling via marginalizing joint distributions; continuous nonlinear latent models implemented with decoder networks.
- The evidence lower bound (ELBO): why exact maximum likelihood is intractable, how the ELBO is derived and interpreted.
- Amortized variational inference with encoder networks, the reparameterization trick for low‑variance gradient estimates, training algorithm and VAE loss.
- Uses: sampling/generation, density estimation, latent manipulations; common extensions and failure modes (blurriness, posterior collapse, latent holes, disentanglement challenges).
- Diffusion Generative Models
- Forward noising (Markov chain / closed‑form diffusion kernel) that maps data to tractable Gaussian latents and a learned reverse denoising chain.
- ELBO decomposition into per‑step KLs and the equivalent noise‑prediction squared‑error loss after reparameterization; supervised denoising training and ancestral sampling.
- Image implementations (time‑conditioned U‑Nets), accelerated sampling techniques (deterministic samplers/ODE solvers, step‑skipping), and cascaded/conditional pipelines for super‑resolution.
- Contrastive Image–Text Embeddings (CLIP)
- Web‑scale caption supervision (WebImageText) trains dual encoders with a symmetric contrastive objective to produce a shared image–text space.
- Practical uses: zero‑shot classification via prompt engineering and ensembling, linear/few‑shot transfer, and improved robustness to distribution shift.
- Limitations: failure modes vs human perception, dataset biases, and deployment risks from uncurated web captions; connection between CLIP and guidance for diffusion.
- Guidance for Conditional Generation
- Classifier guidance: using gradients of an external classifier to steer diffusion sampling toward classes; derivation and deterministic variants (DDIM).
- CLIP and classifier‑based guidance for text conditioning, inpainting, and editing; effects of scaling guidance on fidelity/diversity tradeoffs.
- Classifier‑free guidance: remove the external classifier by training a single model that supports both conditional and unconditional sampling; at sampling time interpolate scores to trade diversity for fidelity, and tune training/sampling hyperparameters.
- Empirical considerations: U‑Net improvements for unconditional quality, metrics for sample quality, how guidance impacts generative behavior rather than adversarial artifacts, costs and hyperparameters.
- Practical and Safety Considerations
- How to build, train, and deploy these models in practice: architectures, losses, sampling speedups, and conditioning strategies (classifier, CLIP, classifier‑free, cascades).
- Evaluation: standard image quality metrics and transfer evaluations.
- Risks: biases from web data, potential misuse of powerful text‑to‑image models, tradeoffs in release decisions, and mitigation strategies (safety fine‑tuning, access controls).
Taken together, these components form a practical toolbox: VAEs for compact latent modeling, diffusion models for state‑of‑the‑art image synthesis, CLIP for flexible text–image supervision and guidance, and guidance methods (classifier and classifier‑free) to control output fidelity and diversity for applications like text‑to‑image, inpainting, and cascaded super‑resolution — all with attention to failure modes, evaluation, and safe deployment.
Units
Chapter 17: Variational autoencoders
How to build, train and use variational autoencoders: ELBO, encoder/decoder, reparameterization, and practical issues.
Chapter 18: Diffusion models
Practical and theoretical introduction to diffusion generative models: forward noising, learned reverse, ELBO derivation, noise-prediction loss, implementation for images, fast sampling, and conditioning/cascades
2021 Clip
Learners will understand how CLIP trains joint image–text embeddings from web captions to enable efficient contrastive learning, zero‑shot classification, robustness under shift, and its practical limitations and risks.
CLIP Guided Image Diffusion
Guiding diffusion models with classifiers and CLIP for high‑quality text‑to‑image generation, measuring and improving sample quality, enabling inpainting/editing, and weighing safety and release trade‑offs.
2022 Classifier Free Diffusion Guidance
How to remove external classifiers and use classifier-free guidance to trade diversity for fidelity in diffusion models