生成モデルの深層学習的定式化

生成モデル(generative model)の目的は、観測データ $x \in \mathcal{X}$ が従う未知の真の分布 $p_{\mathrm{data}}(x)$ を、パラメータ $\theta$ を持つモデル分布 $p_{\theta}(x)$ によって近似することである。この問題は本質的に確率分布推定の問題であり、統計学における密度推定の枠組みを深層学習によって拡張したものである。

深層学習における生成モデルの重要な特徴は、単に $p_{\theta}(x)$ を直接パラメトライズするのではなく、潜在変数 $z \in \mathcal{Z}$ を導入することで、データ生成過程を階層的・構造的に表現する点にある。このようなモデルは潜在変数モデル(latent variable model)と呼ばれ、複雑な分布を低次元の潜在構造を通じて効率的に記述することを可能にする。

基本設定:潜在変数による生成過程

深層生成モデルにおいては、データ生成過程を以下の確率的生成プロセスとして定式化する:

  1. 潜在変数 $z \sim p(z)$ をサンプリングする
  2. 条件付き分布 $p_{\theta}(x|z)$ に従ってデータ $x$ を生成する

ここで、事前分布 $p(z)$ は通常、計算の簡便性と対称性の観点から多変量標準正規分布

\[p(z) = \mathcal{N}(z; 0, I)\]

が仮定されることが多いが、本質的には任意の分布を採用することが可能である。

条件付き分布 $p_{\theta}(x|z)$(デコーダ)は、深層ニューラルネットワーク $f_{\theta}(z)$ によってパラメトライズされ、例えば次のように具体化される:

\[p_{\theta}(x|z) = p(x; f_{\theta}(z))\]

ここで注意すべき点は、「GenericDistribution」という曖昧な表現ではなく、データの性質に応じて具体的な分布族を選択する必要があることである。例えば:

  • 連続値データ:ガウス分布 $\mathcal{N}(x; \mu_{\theta}(z), \Sigma_{\theta}(z))$
  • 二値データ:ベルヌーイ分布
  • カテゴリデータ:カテゴリ分布

このとき、周辺尤度(エビデンス)は次式で与えられる:

\[p_{\theta}(x) = \int p_{\theta}(x|z) p(z),dz\]

しかしながら、この積分は一般に高次元かつ非線形なニューラルネットワークを含むため、解析的に計算することは不可能であり(intractable)、ここに生成モデル学習の主要な困難が存在する。

変分推論とELBOの導入

上記の困難を回避するために、変分推論(variational inference)の枠組みを導入する。すなわち、真の事後分布

\[p_{\theta}(z|x) = \frac{p_{\theta}(x|z)p(z)}{p_{\theta}(x)}\]

を直接扱う代わりに、計算可能な近似分布 $q_{\phi}(z|x)$(エンコーダ)を導入する。このとき、対数周辺尤度は以下のように変形される:

\[\log p_{\theta}(x)= \log \int q_{\phi}(z|x) \frac{p_{\theta}(x,z)}{q_{\phi}(z|x)} dz\]

ここでイェンセンの不等式を適用すると、以下の下界(Evidence Lower Bound, ELBO)が得られる:

\[\log p_{\theta}(x) \geq\mathbb{E}*{q*{\phi}(z|x)} \left[\log \frac{p_{\theta}(x,z)}{q_{\phi}(z|x)}\right]= \mathcal{L}(\theta, \phi; x)\]

さらに分解すると、次の重要な形が得られる:

\[\mathcal{L}(\theta, \phi; x)= \mathbb{E}*{q*{\phi}(z|x)}[\log p_{\theta}(x|z)]* D_{\mathrm{KL}}(q_{\phi}(z|x),|,p(z)) \]

この式は次のように解釈される:

  • 第1項:再構成項(reconstruction term)
    入力データ $x$ を潜在変数 $z$ を介してどれだけ正確に再現できるかを評価する
  • 第2項:正則化項(regularization term)
    近似事後分布が事前分布から逸脱しすぎることを防ぐ

さらに重要な恒等式として、次が成立する:

\[\log p_{\theta}(x)= \mathcal{L}(\theta, \phi; x)* D_{\mathrm{KL}}(q_{\phi}(z|x),|,p_{\theta}(z|x)) \]

したがって、ELBO最大化は、近似事後分布を真の事後分布に近づけることと同値である。

学習の定式化と最適化

データ集合 $\mathcal{D}$ に対する学習は、ELBOの総和を最大化する問題として定式化される:

\[\max_{\theta, \phi} \sum_{x \in \mathcal{D}} \mathcal{L}(\theta, \phi; x)\]

通常は最小化問題として、負のELBOを損失関数とする:

\[\mathcal{J}(\theta, \phi)= \sum_{x \in \mathcal{D}} \left(* \mathbb{E}*{q*{\phi}(z|x)}[\log p_{\theta}(x|z)]- D_{\mathrm{KL}}(q_{\phi}(z|x),|,p(z)) \right) \]

この最適化は確率的勾配降下法(SGD)やその変種(Adamなど)によって実行される。

再パラメータ化トリック

ここで重要な技術的課題は、期待値 $\mathbb{E}_{q_{\phi}(z|x)}$ の勾配計算である。単純なサンプリングでは勾配が流れないため、再パラメータ化トリック(reparameterization trick)を用いる。

例えば、

\[q_{\phi}(z|x) = \mathcal{N}(z; \mu_{\phi}(x), \Sigma_{\phi}(x))\]

としたとき、次のように書き換える:

\[z = \mu_{\phi}(x) + \Sigma_{\phi}(x)^{1/2} \epsilon, \quad\epsilon \sim \mathcal{N}(0, I)\]

これにより、確率的な部分($\epsilon$)とパラメータ依存部分($\mu, \Sigma$)が分離され、勾配が伝播可能となる。

理論的補足:変分推論としての位置づけ

この枠組みは、以下の最適化問題として理解できる:

\[\min_{q_{\phi}} D_{\mathrm{KL}}(q_{\phi}(z|x),|,p_{\theta}(z|x))\]

ただし直接計算が困難であるため、ELBOを最大化することで間接的にこれを達成する。この観点から、VAEは「確率的オートエンコーダ」であると同時に、「変分ベイズ推論のニューラル近似」であると位置づけられる。

まとめ

生成モデルの深層学習的定式化は、複雑なデータ分布を潜在変数を介した確率モデルとして記述し、直接的な尤度最大化の困難を、変分下界(ELBO)の最大化という最適化問題へと帰着させる枠組みである。この構造により、

  • 表現学習(潜在空間の獲得)
  • データ生成(サンプリング)
  • 確率的推論(事後分布の近似)

が統一的に実現される。エンコーダとデコーダからなる双方向ネットワーク構造は、深層学習とベイズ推論を接続する中核的技術であり、現代の生成モデル(VAE、拡散モデル、正規化フローなど)の理論的基盤を成すものである。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習