生成モデル(generative model)の目的は、観測データ $x \in \mathcal{X}$ が従う未知の真の分布 $p_{\mathrm{data}}(x)$ を、パラメータ $\theta$ を持つモデル分布 $p_{\theta}(x)$ によって近似することである。この問題は本質的に確率分布推定の問題であり、統計学における密度推定の枠組みを深層学習によって拡張したものである。
深層学習における生成モデルの重要な特徴は、単に $p_{\theta}(x)$ を直接パラメトライズするのではなく、潜在変数 $z \in \mathcal{Z}$ を導入することで、データ生成過程を階層的・構造的に表現する点にある。このようなモデルは潜在変数モデル(latent variable model)と呼ばれ、複雑な分布を低次元の潜在構造を通じて効率的に記述することを可能にする。
深層生成モデルにおいては、データ生成過程を以下の確率的生成プロセスとして定式化する:
ここで、事前分布 $p(z)$ は通常、計算の簡便性と対称性の観点から多変量標準正規分布
\[p(z) = \mathcal{N}(z; 0, I)\]が仮定されることが多いが、本質的には任意の分布を採用することが可能である。
条件付き分布 $p_{\theta}(x|z)$(デコーダ)は、深層ニューラルネットワーク $f_{\theta}(z)$ によってパラメトライズされ、例えば次のように具体化される:
\[p_{\theta}(x|z) = p(x; f_{\theta}(z))\]ここで注意すべき点は、「GenericDistribution」という曖昧な表現ではなく、データの性質に応じて具体的な分布族を選択する必要があることである。例えば:
このとき、周辺尤度(エビデンス)は次式で与えられる:
\[p_{\theta}(x) = \int p_{\theta}(x|z) p(z),dz\]しかしながら、この積分は一般に高次元かつ非線形なニューラルネットワークを含むため、解析的に計算することは不可能であり(intractable)、ここに生成モデル学習の主要な困難が存在する。
上記の困難を回避するために、変分推論(variational inference)の枠組みを導入する。すなわち、真の事後分布
\[p_{\theta}(z|x) = \frac{p_{\theta}(x|z)p(z)}{p_{\theta}(x)}\]を直接扱う代わりに、計算可能な近似分布 $q_{\phi}(z|x)$(エンコーダ)を導入する。このとき、対数周辺尤度は以下のように変形される:
\[\log p_{\theta}(x)= \log \int q_{\phi}(z|x) \frac{p_{\theta}(x,z)}{q_{\phi}(z|x)} dz\]ここでイェンセンの不等式を適用すると、以下の下界(Evidence Lower Bound, ELBO)が得られる:
\[\log p_{\theta}(x) \geq\mathbb{E}*{q*{\phi}(z|x)} \left[\log \frac{p_{\theta}(x,z)}{q_{\phi}(z|x)}\right]= \mathcal{L}(\theta, \phi; x)\]さらに分解すると、次の重要な形が得られる:
\[\mathcal{L}(\theta, \phi; x)= \mathbb{E}*{q*{\phi}(z|x)}[\log p_{\theta}(x|z)]* D_{\mathrm{KL}}(q_{\phi}(z|x),|,p(z)) \]この式は次のように解釈される:
さらに重要な恒等式として、次が成立する:
\[\log p_{\theta}(x)= \mathcal{L}(\theta, \phi; x)* D_{\mathrm{KL}}(q_{\phi}(z|x),|,p_{\theta}(z|x)) \]したがって、ELBO最大化は、近似事後分布を真の事後分布に近づけることと同値である。
データ集合 $\mathcal{D}$ に対する学習は、ELBOの総和を最大化する問題として定式化される:
\[\max_{\theta, \phi} \sum_{x \in \mathcal{D}} \mathcal{L}(\theta, \phi; x)\]通常は最小化問題として、負のELBOを損失関数とする:
\[\mathcal{J}(\theta, \phi)= \sum_{x \in \mathcal{D}} \left(* \mathbb{E}*{q*{\phi}(z|x)}[\log p_{\theta}(x|z)]- D_{\mathrm{KL}}(q_{\phi}(z|x),|,p(z)) \right) \]この最適化は確率的勾配降下法(SGD)やその変種(Adamなど)によって実行される。
ここで重要な技術的課題は、期待値 $\mathbb{E}_{q_{\phi}(z|x)}$ の勾配計算である。単純なサンプリングでは勾配が流れないため、再パラメータ化トリック(reparameterization trick)を用いる。
例えば、
\[q_{\phi}(z|x) = \mathcal{N}(z; \mu_{\phi}(x), \Sigma_{\phi}(x))\]としたとき、次のように書き換える:
\[z = \mu_{\phi}(x) + \Sigma_{\phi}(x)^{1/2} \epsilon, \quad\epsilon \sim \mathcal{N}(0, I)\]これにより、確率的な部分($\epsilon$)とパラメータ依存部分($\mu, \Sigma$)が分離され、勾配が伝播可能となる。
この枠組みは、以下の最適化問題として理解できる:
\[\min_{q_{\phi}} D_{\mathrm{KL}}(q_{\phi}(z|x),|,p_{\theta}(z|x))\]ただし直接計算が困難であるため、ELBOを最大化することで間接的にこれを達成する。この観点から、VAEは「確率的オートエンコーダ」であると同時に、「変分ベイズ推論のニューラル近似」であると位置づけられる。
生成モデルの深層学習的定式化は、複雑なデータ分布を潜在変数を介した確率モデルとして記述し、直接的な尤度最大化の困難を、変分下界(ELBO)の最大化という最適化問題へと帰着させる枠組みである。この構造により、
が統一的に実現される。エンコーダとデコーダからなる双方向ネットワーク構造は、深層学習とベイズ推論を接続する中核的技術であり、現代の生成モデル(VAE、拡散モデル、正規化フローなど)の理論的基盤を成すものである。
Mathematics is the language with which God has written the universe.