NNGPと不確実性の定量化

ニューラルネットワークとガウス過程の等価性(NNGP)に基づく「不確実性の定量化」とは、ニューラルネットワークの予測を単なる点推定ではなく、確率分布として記述し、そのばらつき(分散)や信頼区間を厳密に評価する枠組みである。この観点は、従来の勾配降下法に基づくニューラルネットワークが本質的に決定論的な予測を行うのに対し、関数空間上の確率測度を明示的に扱う点で本質的に異なる。

関数分布としての予測

NNGPでは、無限幅極限において出力関数 $f$ はガウス過程に従う:

\[f \sim \mathcal{GP}(0, k_{\mathrm{NNGP}})\]

このとき、任意の入力点 $x$ に対する予測は確率変数であり、その分布は

\[f(x) \mid \mathcal{D} \sim \mathcal{N}(m(x), v(x))\]

と表される。ここで平均 $m(x)$ は予測値、分散 $v(x)$ は不確実性の定量化に対応する。

予測分散の構造

分散 $v(x)$ は以下で与えられる:

\[v(x) = k(x,x) - k(x,X)\bigl(k(X,X)+\sigma^2 I\bigr)^{-1}k(X,x)\]

この式は、予測不確実性が以下の二つの要因によって決定されることを示している:

  • 事前分散 $k(x,x)$:データが存在しない場合の不確実性
  • データによる減少項:既存データとの相関により不確実性がどれだけ削減されるか

特に、$x$ が訓練データ点に近い場合、$k(x,X)$ が大きくなり、不確実性は小さくなる。一方、データから遠い領域では分散は大きく保たれる。

不確実性の幾何学的解釈

カーネル $k$ に対応する再生核ヒルベルト空間(RKHS)$\mathcal{H}_k$ において、予測分散は「評価汎関数のノルム」として解釈できる。すなわち

\[v(x) = \|k(x,\cdot) - P_X k(x,\cdot)\|_{\mathcal{H}_k}^2\]

ここで $P_X$ は訓練データによって張られる部分空間への射影である。この式は、不確実性が「既知の関数空間でどれだけ再現できないか」という幾何学的量であることを示す。

エピステミック不確実性とアレアトリック不確実性

NNGPにおける不確実性は主に以下の二種類に分解される:

  • エピステミック不確実性:モデルの知識不足に由来し、データが増えると減少する($k(x,X)$ に依存)
  • アレアトリック不確実性:観測ノイズ $\sigma^2$ に由来し、不可約である

予測分布の分散はこれらの寄与を合わせたものとして現れる。

信頼区間とベイズ的意思決定

予測分布がガウス分布であるため、任意の信頼水準 $\alpha$ に対して信頼区間は

\[[m(x) - z_{\alpha}\sqrt{v(x)}, \; m(x) + z_{\alpha}\sqrt{v(x)}]\]

として明示的に与えられる。この構造により、単なる予測値だけでなく、その信頼性を同時に評価できる。

この性質は、ベイズ最適化や探索問題において重要であり、例えばUCB(Upper Confidence Bound)戦略では

\[\mathrm{UCB}(x) = m(x) + \beta \sqrt{v(x)}\]

のように平均と不確実性を組み合わせて意思決定が行われる。

深さと不確実性構造

NNGPではカーネルが層ごとに再帰的に更新されるため、不確実性の構造も深さに依存する。深いネットワークでは、入力間の相関構造が変形されることで、どの領域で不確実性が大きくなるかが変化する。

ただし、深さが増すとカーネルが固定点に収束し、すべての入力が強く相関する場合がある。このとき分散が一様に小さくなり、不確実性の識別能力が低下する可能性がある。

有限幅ネットワークとの比較

通常のニューラルネットワークでは、予測は

\[\hat{y} = f_W(x)\]

という一点で与えられ、不確実性は直接得られない。そのため、ドロップアウトやアンサンブルなどの近似手法が用いられる。

これに対しNNGPでは、不確実性は理論的に一意に定まり、追加の近似なしに解析的に計算される。この点は大きな利点である。

計算的制約とスケーラビリティ

一方で、NNGPの実用上の制約として、カーネル行列 $K(X,X)$ の逆行列計算が $O(n^3)$ の計算量を要する点が挙げられる。このため大規模データに対しては近似法(低ランク近似、ランダム特徴など)が必要となる。

まとめ

NNGPにおける不確実性の定量化は、関数空間上のガウス過程としてニューラルネットワークを捉えることで、予測を平均と分散を持つ確率分布として厳密に記述する枠組みである。この分散は、データとの相関構造および観測ノイズにより決定され、幾何学的・情報論的に解釈可能である。従来のニューラルネットワークが点推定に留まるのに対し、NNGPは予測の信頼性を内在的に評価できる点で本質的な優位性を持つが、その一方で計算コストや有限幅との乖離といった制約も存在する。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習