拡散確率モデル(DDPMとその応用)

拡散確率モデル(Diffusion Probabilistic Models)は、非平衡統計力学における拡散過程および時間反転ダイナミクスを、確率生成モデルとして再定式化した枠組みである。特に Denoising Diffusion Probabilistic Models(DDPM)は、データに対して段階的にノイズを加える「順方向過程」と、その逆にノイズを除去する「逆過程」をマルコフ連鎖として構成することで、高品質かつ安定した生成を実現する。

このモデルの本質は、複雑なデータ分布を直接近似するのではなく、単純なガウス分布へと連続的に変形する過程を設計し、その逆変換を学習する点にある。この視点により、尤度の直接最大化に伴う困難を回避しつつ、理論的にも安定した学習が可能となる。

基本設定

DDPMでは、データ $x_0 \sim q(x_0)$ に対して、逐次的にガウスノイズを加える順方向過程を定義する。この過程は以下のマルコフ連鎖として与えられる。

\[q(x_t \mid x_{t-1}) = \mathcal{N}(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I)\]

ここで $\beta_t \in (0,1)$ は分散スケジュールであり、時間とともに増加するように設計される。$\alpha_t = 1 - \beta_t$ と定義すると、この遷移は信号減衰とノイズ付加の線形結合とみなせる。

この過程を繰り返すと、最終時刻 $T$ において分布は以下に近づく。

\[q(x_T) \approx \mathcal{N}(0, I)\]

重要な性質として、任意の時刻 $t$ における $x_t$ は $x_0$ から直接サンプリング可能である。

\[q(x_t \mid x_0) = \mathcal{N}(x_t; \sqrt{\bar{\alpha}_t} x_0, (1 - \bar{\alpha}_t) I)\]

ここで

\[\alpha_t = 1 - \beta_t, \quad \bar{\alpha}_t = \prod_{s=1}^{t} \alpha_s\]

である。したがって、$x_t$ は以下のように表される。

\[x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon, \quad \epsilon \sim \mathcal{N}(0, I)\]

この式は、データとノイズの線形補間として拡散過程を理解できることを示している。

逆拡散プロセスと学習の定式化

生成の目的は、この順方向過程の逆過程をモデル化することである。逆遷移は以下のようにガウス分布として近似される。

\[p_{\theta}(x_{t-1} \mid x_t) = \mathcal{N}(x_{t-1}; \mu_{\theta}(x_t, t), \Sigma_{\theta}(x_t, t))\]

真の逆分布は、$x_0$ が既知であれば次のように書ける。

\[q(x_{t-1} \mid x_t, x_0) = \mathcal{N}(x_{t-1}; \tilde{\mu}(x_t, x_0), \tilde{\beta}_t I)\]

ここで平均は

\[\tilde{\mu}(x_t, x_0) =\frac{1}{\sqrt{\alpha_t}}\left(x_t - \frac{\beta_t}{\sqrt{1 - \bar{\alpha}_t}} x_0\right)\]

である。しかし $x_0$ は未知であるため、これを直接利用することはできない。そこで DDPM では、$x_0$ の代わりにノイズ $\epsilon$ を予測する形に問題を変換する。

\[x_0 =\frac{1}{\sqrt{\bar{\alpha}_t}}\left(x_t - \sqrt{1 - \bar{\alpha}_t} \epsilon\right)\]

この再表現により、モデルは $\epsilon_{\theta}(x_t, t)$ を推定すればよいことになる。

その結果、学習は以下の単純な二乗誤差最小化へと帰着される。

\[\mathcal{L}_{simple}(\theta)=\mathbb{E}_{t, x_0, \epsilon}\left[\left\|\epsilon - \epsilon_{\theta}(x_t, t)\right\|^2\right]\]

ここで

\[x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon\]

である。この簡約は、変分下界(ELBO)の分解に基づく厳密な結果であり、経験的な近似ではない。

サンプリングと生成のアルゴリズム

学習後の生成は、ノイズから開始して逐次的にノイズを除去する過程として実行される。

\[x_T \sim \mathcal{N}(0, I)\]

から出発し、次の更新を繰り返す。

\[x_{t-1}=\frac{1}{\sqrt{\alpha_t}}\left(x_t -\frac{\beta_t}{\sqrt{1 - \bar{\alpha}_t}}\epsilon_{\theta}(x_t, t)\right)+\sigma_t z, \quad z \sim \mathcal{N}(0, I)\]

この更新式は、「ノイズ推定に基づく補正項」と「確率的揺らぎ」の和として構成されている。前者がデータ構造の復元を担い、後者が多様性を保証する。

応用展開:条件付き生成と潜在空間

DDPMは様々な拡張を通じて応用範囲を拡大している。条件付き生成では、ラベルやテキスト $y$ を条件として組み込み、スコア関数を制御することで生成内容を誘導する。さらに、潜在空間で拡散を行う Latent Diffusion Models は、計算効率を大幅に向上させつつ高解像度生成を可能にした。

まとめ

拡散確率モデルは、複雑な分布生成を「ノイズ付加と除去」という単純な操作の反復へと還元することで、安定かつ高品質な生成を実現した。その理論的基盤はスコア関数推定および確率過程にあり、現代の生成AIの中核を成す枠組みとなっている。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習