スコアベース生成モデル(拡散モデルの理論的基盤)

スコアベース生成モデルは、確率密度関数そのものではなく、その対数密度の勾配(スコア関数)を直接学習することによってデータ分布を記述する枠組みである。このアプローチは、正規化定数を含む尤度の直接最大化を回避しつつ、高次元分布の幾何構造をベクトル場として捉える点に本質がある。統計力学におけるエネルギー勾配や確率過程論と深い関係を持ち、現代の拡散モデルの理論的基盤を構成する。

基本設定とスコア関数の意味

未知のデータ分布 $p_{\mathrm{data}}(x)$ に対して、そのスコア関数は次で定義される:

\[\psi(x) = \nabla_x \log p_{\mathrm{data}}(x)\]

この量は、点 $x$ における「確率密度の増加方向」を与えるベクトル場である。すなわち、$\psi(x)$ は局所的に最も確率が高くなる方向を指し、分布の幾何構造(等高線構造)を完全に特徴づける。

特に、エネルギーベースモデル

\[p(x) = \frac{\exp(-E(x))}{Z}\]

に対しては、

\[\nabla_x \log p(x) = -\nabla_x E(x)\]

となり、正規化定数 $Z$ が消去される。この性質により、スコア関数は正規化定数に依存せずに計算可能であり、未正規化モデルに対する自然な学習対象となる。

スコアマッチングとFisher距離

モデル $s_{\theta}(x)$ によって真のスコアを近似するために、Fisherダイバージェンスに基づく目的関数を考える:

\[\mathcal{J}(\theta)=\mathbb{E}_{p_{\mathrm{data}}(x)}\left[\frac{1}{2}\| s_{\theta}(x) - \nabla_x \log p_{\mathrm{data}}(x) \|^2\right]\]

この目的関数は、モデルと真の分布の「微分構造の差」を測るものであり、KLダイバージェンスとは異なる幾何学的意味を持つ。

未知の項を除去するため、部分積分(境界項が消えるという仮定のもと)を用いると、次の等価表現が得られる:

\[\mathcal{J}(\theta)=\mathbb{E}_{p_{\mathrm{data}}(x)}\left[\mathrm{tr}(\nabla_x s_{\theta}(x))+\frac{1}{2}\|s_{\theta}(x)\|^2\right]+ \mathrm{const.}\]

ここで $\mathrm{tr}(\nabla_x s_{\theta}(x))$ はヤコビアンのトレースであり、発散(divergence)に対応する。この項は高次元では計算コストが大きく、Hutchinson推定

\[\mathrm{tr}(A)=\mathbb{E}_{v \sim \mathcal{N}(0,I)}[v^{\top} A v]\]

により近似される。

デノイジング・スコアマッチング(DSM)

実用上は、ノイズを付加した分布に対するスコアを学習するデノイジング・スコアマッチングが用いられる。ノイズ付きデータを

\[\tilde{x} = x + \sigma \epsilon, \quad \epsilon \sim \mathcal{N}(0,I)\]

とすると、目的関数は次のように書ける:

\[\mathbb{E}_{p_{\mathrm{data}}(x), \epsilon}\left[\left\|s_{\theta}(\tilde{x}, \sigma)+\frac{\tilde{x} - x}{\sigma^2}\right\|^2\right]\]

ここで $\frac{\tilde{x} - x}{\sigma^2}$ はノイズ付き分布の真のスコアである。この形式により、高次元においても安定に学習が可能となる。

ランジュバン動力学と生成過程

学習されたスコアを用いてサンプルを生成するには、ランジュバン動力学を用いる:

\[x_{t+1}=x_t+\epsilon s_{\theta}(x_t)+\sqrt{2\epsilon} z_t, \quad z_t \sim \mathcal{N}(0,I)\]

この更新は、確率密度の勾配に従うドリフト項と、拡散項(ブラウン運動)から構成される。連続時間極限では、確率微分方程式

\[dx_t = \nabla_x \log p(x_t) dt + \sqrt{2} dW_t\]

に対応し、その定常分布は $p(x)$ に一致する。

ノイズ条件付きモデルと多スケール構造

単一スケールでは低密度領域の推定が困難であるため、複数のノイズレベル $\{\sigma_i\}$ に対するスコアを同時に学習する:

\[s_{\theta}(x, \sigma_i) \approx \nabla_x \log p_{\sigma_i}(x)\]

ここで $p_{\sigma_i}$ はガウス畳み込みされた分布である。この多スケール構造により、粗視化から詳細構造まで段階的に復元可能となる。

SDEによる統一的定式化

拡散過程は一般に以下の確率微分方程式で記述される:

\[dx = f(x,t)dt + g(t)dW_t\]

このとき、時間反転された逆過程は次で与えられる:

\[dx =\left[f(x,t) - g(t)^2 \nabla_x \log p_t(x)\right] dt+g(t) d\bar{W}_t\]

この式の重要性は、「スコア関数を推定すること」が「拡散過程の逆過程を構成すること」と同値である点にある。すなわち、生成とはノイズの除去過程として解釈される。

ODE表現と確率性の排除

同一の周辺分布を持つ決定論的過程として、確率微分方程式は次の常微分方程式(Probability Flow ODE)に変換できる:

\[\frac{dx}{dt}=f(x,t)-\frac{1}{2}g(t)^2\nabla_x \log p_t(x)\]

この形式により、サンプリングは確率過程ではなく常微分方程式の数値解法として実行可能となる。

まとめ

スコアベース生成モデルは、確率分布をその勾配場として表現することで、正規化定数の問題を回避しつつ高次元分布の学習を可能にする。スコアマッチング、ランジュバン動力学、SDEによる時間発展という三つの要素は統一的に結びついており、拡散モデルの理論的基盤を構成する。特に、スコア推定と逆拡散の同値性は、現代の生成モデルにおける最も重要な洞察の一つである。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習