座標上昇型変分推論(CAVI)

座標上昇型変分推論(Coordinate Ascent Variational Inference; CAVI)は、変分推論において証拠下界(Evidence Lower Bound; ELBO)を最大化するための最も基本的かつ重要なアルゴリズムである。特に、平均場近似(mean-field approximation)という構造制約のもとで、汎関数最適化問題を逐次的な更新問題へと分解する役割を担う。

変分推論の目的は、真の事後分布 $p(\mathbf{z} \mid \mathbf{x})$ を直接求める代わりに、近似分布 $q(\mathbf{z})$ を用いて

\[\mathrm{KL}(q(\mathbf{z}) ,|, p(\mathbf{z} \mid \mathbf{x}))\]

を最小化することである。この問題は、同値にELBO

\[\mathcal{L}(q)= \mathbb{E}_{q(\mathbf{z})}[\log p(\mathbf{x}, \mathbf{z})]* \mathbb{E}_{q(\mathbf{z})}[\log q(\mathbf{z})] \]

を最大化する問題として書き換えられる。CAVIは、このELBO最大化問題に対して座標上昇法を適用したものである。

基本設定:平均場分解と関数空間上の最適化

平均場近似のもとでは、近似分布は以下のように完全に因子分解される:

\[q(\mathbf{z}) = \prod_{j=1}^{M} q_j(z_j)\]

ここで各 $q_j$ は確率分布(すなわち非負かつ正規化条件を満たす関数)であり、有限次元のパラメータではなく「関数そのもの」が最適化対象となる。この意味で、CAVIは通常の多変数最適化ではなく、関数空間上の座標上昇法である。

この分解により、ELBOは各因子に関する項へと分解され、各 $q_j$ を他の因子を固定したもとで最適化できる構造が生じる。

更新式の導出:変分法による最適条件

各因子 $q_j(z_j)$ の最適化は、制約付き汎関数最適化問題として定式化される。すなわち、正規化制約

\[\int q_j(z_j),dz_j = 1\]

のもとでELBOを最大化する。ラグランジュ乗数法を用いて変分微分を計算すると、最適条件として次式が得られる:

\[\log q_j^*(z_j)= \mathbb{E}_{i \neq j}[\log p(\mathbf{x}, \mathbf{z})] + \mathrm{const.}\]

すなわち、

\[q_j^*(z_j)\propto \exp\left( \mathbb{E}_{i \neq j}[\log p(\mathbf{x}, \mathbf{z})] \right)\]

である。この結果は、各因子の対数が「完全データ対数尤度の他変数に関する期待値」に一致することを意味する。

重要なのは、この更新が「閉形式」で与えられる点であり、これがCAVIの計算効率の根幹をなしている。

アルゴリズムとしてのCAVI

CAVIは以下の反復アルゴリズムとして実装される:

(1) 初期分布 $\{q_j^{(0)}\}_{j=1}^M$ を設定する
(2) 反復 $t = 0,1,2,\dots$ に対して:

\[q_j^{(t+1)}(z_j)\propto \exp\left(\mathbb{E}_{i \neq j}^{(t)}[\log p(\mathbf{x}, \mathbf{z})]\right)\quad (\forall j)\]

(3) ELBO $\mathcal{L}(q^{(t)})$ が収束するまで繰り返す

更新順序は逐次(cyclic)でもランダムでもよいが、理論的にはいずれの場合もELBOは単調非減少となる。

ただし、実装上は以下のような収束判定が用いられる:

  • $|\mathcal{L}^{(t+1)} - \mathcal{L}^{(t)}| < \varepsilon$
  • 各パラメータの変化量が十分小さい
  • 最大反復回数に到達

指数型分布族と共役性

モデル $p(\mathbf{x}, \mathbf{z})$ が指数型分布族に属し、かつ共役事前分布を持つ場合、CAVIの更新は特に単純化される。このとき、各 $q_j$ も同じ分布族に属し、その自然パラメータは他の変数の期待値によって更新される。

この構造により、CAVIは以下のように解釈できる:

  • 自然パラメータの期待値更新
  • グラフィカルモデルにおけるメッセージパッシング
  • 期待値伝播(Expectation Propagation)との類似構造

この性質は、潜在ディリクレ配分法(LDA)やガウス混合モデル(GMM)などにおいて解析的更新式を可能にする。

収束性と理論的性質

CAVIは以下の性質を持つ:

  • 各更新ステップでELBOは単調非減少
  • ELBOは上に有界であるため収束する
  • ただし一般には大域最適解ではなく局所最適解に収束する

また、ELBOは一般に非凸関数であるため、初期値に強く依存する。したがって、複数初期化やヒューリスティックな初期値選択が重要となる。

計算量とスケーラビリティ

CAVIの計算量は、各更新における期待値計算のコストに依存する。特に:

  • 各因子の更新は他のすべての因子に依存する
  • 大規模データでは1回の更新が高コストになる

この問題に対しては、以下のような拡張が提案されている:

  • 確率的変分推論(Stochastic Variational Inference; SVI):ミニバッチによる近似
  • オンラインCAVI:逐次データ更新
  • 分散CAVI:並列計算による高速化

限界と実務上の注意

CAVIは非常に効率的である一方で、平均場近似に由来する以下の制約を持つ:

  • 変数間の相関を表現できない
  • 分散を過小評価する傾向(過度に確信的)
  • 多峰性を捉えにくい

また、更新式が解析的に求まらないモデル(非共役モデル)では、そのまま適用できず、以下のような手法が必要となる:

  • ブラックボックス変分推論(BBVI)
  • 再パラメータ化トリック(reparameterization trick)
  • 勾配ベースの変分推論

まとめ

座標上昇型変分推論(CAVI)は、平均場近似のもとでELBO最大化を効率的に実現するための基本アルゴリズムであり、関数空間上の最適化問題を逐次的な更新へと分解する枠組みである。閉形式の更新式、単調収束性、実装の容易さといった利点により、多くのベイズモデルにおいて標準的手法として用いられている。

一方で、その性能はモデル構造と初期値に強く依存し、独立性仮定による表現力の制限という本質的な課題を持つ。そのため、現代の大規模ベイズ推論では、CAVIを基盤としつつも、確率的近似や深層学習的手法と組み合わせた拡張が重要な役割を果たしているのである。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習