GAN vs. VAE vs. Diffusion
GAN、VAE、拡散モデルの3つの生成モデルを比較解説。それぞれの仕組み、長所・短所を整理し、画像生成タスクにおける適した用途を紹介する。
背景メモ
GAN(敵対的生成ネットワーク)、VAE(変分オートエンコーダ)、拡散モデルは、画像や音声などのデータを生成する深層学習の三大大手法。GANは生成器と識別器を競わせる方式で鮮明な画像を作るが訓練が不安定。VAEは確率的な潜在変数を使い安定した学習が可能だが出力がぼやけがち。2020年以降、拡散モデル(Stable Diffusion、DALL·E、Midjourneyの基盤技術)が品質・多様性で圧倒し、現在の画像生成AIの主力に。この比較記事は、仕組みの違い・長所短所・用途を整理したもので、生成AIの基本動向を追う読者向け。