座標上昇型変分推論(Coordinate Ascent Variational Inference; CAVI)は、変分推論において証拠下界(Evidence Lower Bound; ELBO)を最大化するための最も基本的かつ重要なアルゴリズムである。特に、平均場近似(mean-field approximation)という構造制約のもとで、汎関数最適化問題を逐次的な更新問題へと分解する役割を担う。
変分推論の目的は、真の事後分布 $p(\mathbf{z} \mid \mathbf{x})$ を直接求める代わりに、近似分布 $q(\mathbf{z})$ を用いて
\[\mathrm{KL}(q(\mathbf{z}) ,|, p(\mathbf{z} \mid \mathbf{x}))\]を最小化することである。この問題は、同値にELBO
\[\mathcal{L}(q)= \mathbb{E}_{q(\mathbf{z})}[\log p(\mathbf{x}, \mathbf{z})]* \mathbb{E}_{q(\mathbf{z})}[\log q(\mathbf{z})] \]を最大化する問題として書き換えられる。CAVIは、このELBO最大化問題に対して座標上昇法を適用したものである。
平均場近似のもとでは、近似分布は以下のように完全に因子分解される:
\[q(\mathbf{z}) = \prod_{j=1}^{M} q_j(z_j)\]ここで各 $q_j$ は確率分布(すなわち非負かつ正規化条件を満たす関数)であり、有限次元のパラメータではなく「関数そのもの」が最適化対象となる。この意味で、CAVIは通常の多変数最適化ではなく、関数空間上の座標上昇法である。
この分解により、ELBOは各因子に関する項へと分解され、各 $q_j$ を他の因子を固定したもとで最適化できる構造が生じる。
各因子 $q_j(z_j)$ の最適化は、制約付き汎関数最適化問題として定式化される。すなわち、正規化制約
\[\int q_j(z_j),dz_j = 1\]のもとでELBOを最大化する。ラグランジュ乗数法を用いて変分微分を計算すると、最適条件として次式が得られる:
\[\log q_j^*(z_j)= \mathbb{E}_{i \neq j}[\log p(\mathbf{x}, \mathbf{z})] + \mathrm{const.}\]すなわち、
\[q_j^*(z_j)\propto \exp\left( \mathbb{E}_{i \neq j}[\log p(\mathbf{x}, \mathbf{z})] \right)\]である。この結果は、各因子の対数が「完全データ対数尤度の他変数に関する期待値」に一致することを意味する。
重要なのは、この更新が「閉形式」で与えられる点であり、これがCAVIの計算効率の根幹をなしている。
CAVIは以下の反復アルゴリズムとして実装される:
(1) 初期分布 $\{q_j^{(0)}\}_{j=1}^M$ を設定する
(2) 反復 $t = 0,1,2,\dots$ に対して:
(3) ELBO $\mathcal{L}(q^{(t)})$ が収束するまで繰り返す
更新順序は逐次(cyclic)でもランダムでもよいが、理論的にはいずれの場合もELBOは単調非減少となる。
ただし、実装上は以下のような収束判定が用いられる:
モデル $p(\mathbf{x}, \mathbf{z})$ が指数型分布族に属し、かつ共役事前分布を持つ場合、CAVIの更新は特に単純化される。このとき、各 $q_j$ も同じ分布族に属し、その自然パラメータは他の変数の期待値によって更新される。
この構造により、CAVIは以下のように解釈できる:
この性質は、潜在ディリクレ配分法(LDA)やガウス混合モデル(GMM)などにおいて解析的更新式を可能にする。
CAVIは以下の性質を持つ:
また、ELBOは一般に非凸関数であるため、初期値に強く依存する。したがって、複数初期化やヒューリスティックな初期値選択が重要となる。
CAVIの計算量は、各更新における期待値計算のコストに依存する。特に:
この問題に対しては、以下のような拡張が提案されている:
CAVIは非常に効率的である一方で、平均場近似に由来する以下の制約を持つ:
また、更新式が解析的に求まらないモデル(非共役モデル)では、そのまま適用できず、以下のような手法が必要となる:
座標上昇型変分推論(CAVI)は、平均場近似のもとでELBO最大化を効率的に実現するための基本アルゴリズムであり、関数空間上の最適化問題を逐次的な更新へと分解する枠組みである。閉形式の更新式、単調収束性、実装の容易さといった利点により、多くのベイズモデルにおいて標準的手法として用いられている。
一方で、その性能はモデル構造と初期値に強く依存し、独立性仮定による表現力の制限という本質的な課題を持つ。そのため、現代の大規模ベイズ推論では、CAVIを基盤としつつも、確率的近似や深層学習的手法と組み合わせた拡張が重要な役割を果たしているのである。
Mathematics is the language with which God has written the universe.