ベイズ推論において、潜在変数 $\mathbf{z}$ に関する事後分布 $p(\mathbf{z} \mid \mathbf{x})$ を厳密に計算することは、一般に高次元積分を伴うため計算的に困難である。この困難を回避するために、近似分布 $q(\mathbf{z})$ を導入し、真の事後分布に近い分布を最適化によって求める枠組みが変分推論(Variational Inference)である。
変分推論では、近似分布のクラス $\mathcal{Q}$ をあらかじめ定め、その中で真の事後分布との距離、通常はKullback–Leiblerダイバージェンス
\[\mathrm{KL}(q(\mathbf{z}) ,|, p(\mathbf{z} \mid \mathbf{x}))\]を最小化することを目的とする。この最適化問題は、同値に証拠下界(Evidence Lower Bound, ELBO)
\[\mathcal{L}(q) = \mathbb{E}*{q(\mathbf{z})}[\log p(\mathbf{x}, \mathbf{z})] - \mathbb{E}*{q(\mathbf{z})}[\log q(\mathbf{z})]\]を最大化する問題として定式化される。
このとき、$\mathcal{Q}$ の選び方が計算可能性と近似精度のトレードオフを決定する。最も基本的かつ広く用いられる選択が平均場近似(Mean Field Approximation)である。
平均場近似では、多変量の潜在変数 $\mathbf{z} = (z_1, z_2, \dots, z_M)$ に対して、近似分布が完全に因子分解されると仮定する:
\[q(\mathbf{z}) = \prod_{j=1}^{M} q_j(z_j)\]この仮定は「独立性の仮定」と呼ばれるが、厳密には真の事後分布における独立性ではなく、「近似分布における構造的制約」である点に注意が必要である。すなわち、実際には強い相関を持つ変数であっても、近似のためにそれを切り捨てる。
この分解により、ELBOは以下のように書き直される:
\[\mathcal{L}(q)= \int \left( \prod_{j=1}^{M} q_j(z_j) \right) \log p(\mathbf{x}, \mathbf{z}) , d\mathbf{z}* \sum_{j=1}^{M} \int q_j(z_j) \log q_j(z_j) , dz_j \]この形式は、各因子 $q_j$ に関する汎関数最適化問題へと分解可能であることを示唆する。
平均場近似の本質は、各因子 $q_j(z_j)$ を他の因子を固定したもとで最適化する「座標上昇法(coordinate ascent)」にある。この最適化は、汎関数微分を用いて導出される。
制約 $\int q_j(z_j) dz_j = 1$ をラグランジュ乗数 $\lambda_j$ により課し、以下の汎関数を考える:
\[\mathcal{J}[q_j]= \mathcal{L}(q) + \lambda_j \left( \int q_j(z_j) dz_j - 1 \right)\]これに対して変分微分をとると、最適条件として次が得られる:
\[\frac{\delta \mathcal{J}}{\delta q_j(z_j)} = 0\]計算を進めると、最適な因子は次の形を持つことが導かれる:
\[\log q_j^*(z_j)= \mathbb{E}_{i \neq j} [\log p(\mathbf{x}, \mathbf{z})] + \text{const}\]すなわち、
\[q_j^*(z_j)= \frac{\exp\left( \mathbb{E}_{i \neq j} [\log p(\mathbf{x}, \mathbf{z})] \right)}{Z_j}\]ここで $Z_j$ は正規化定数である:
\[Z_j = \int \exp\left( \mathbb{E}_{i \neq j} [\log p(\mathbf{x}, \mathbf{z})] \right) dz_j\]この結果は提示された式と本質的に同じであるが、重要なのは「対数の形で導出される」点であり、これは指数型分布族との深い関係を示している。
モデル $p(\mathbf{x}, \mathbf{z})$ が指数型分布族に属し、かつ共役事前分布を持つ場合、上記の期待値計算は解析的に実行できる。このとき、各因子 $q_j$ も同じ指数型分布族に属することが保証される。
すなわち、
\[p(\mathbf{x}, \mathbf{z})= h(\mathbf{z}) \exp\left( \eta(\mathbf{x})^\top T(\mathbf{z}) - A(\eta(\mathbf{x})) \right)\]のように書ける場合、平均場更新は自然パラメータ $\eta$ の期待値に対応する更新則として解釈される。この構造により、変分推論は「期待値伝播」あるいは「メッセージパッシング」と密接に関連する。
平均場近似は以下の反復アルゴリズムとして実装される:
(1) 初期分布 $\{q_j^{(0)}\}$ を設定する
(2) 各 $j$ に対して\[q_j^{(t+1)}(z_j) \propto \exp\left( \mathbb{E}_{i \neq j}^{(t)} [\log p(\mathbf{x}, \mathbf{z})] \right)\]を計算する
(3) 収束するまで繰り返す
このアルゴリズムはELBOを単調に増加させることが知られており、局所最適解へ収束する。
平均場近似の最大の欠点は、変数間の相関を完全に無視する点にある。この結果として:
特に、KLダイバージェンス $\mathrm{KL}(q \| p)$ を最小化するため、「モード探索的(mode-seeking)」な性質を持つことが知られている。
この制約を緩和するために、以下のような拡張が提案されている:
これらは平均場近似の計算効率をある程度維持しつつ、近似精度を向上させる試みである。
平均場近似は、変分推論において最も基本的かつ重要な近似手法であり、事後分布推定を高次元積分問題から座標ごとの最適化問題へと還元する。汎関数最適化としての明確な理論的基盤を持ち、指数型分布族との整合性により解析的更新が可能となる点が大きな利点である。
一方で、独立性仮定による表現力の制限は本質的な課題であり、現代の研究ではその緩和や拡張が重要なテーマとなっている。したがって平均場近似は、単なる近似手法にとどまらず、確率推論の計算理論における基盤的枠組みとして位置づけられるのである。
Mathematics is the language with which God has written the universe.