通常のニューラルネットワークは「128ユニット」のように幅が固定されている。数学的な解析のために、この幅を無限大に増やした極限の状態を想定したモデルを無限幅ネットワークという。
一方、ガウス過程(Gaussian Process)とは、データが無限次元の多変量正規分布に従うと考える統計モデル。
1994年、ラドフォード・ニール(Radford M. Neal)は、ニューラルネットワークの隠れ層の幅(ユニット数)をどんどん増やしていき、その数が限りなく大きい状態(極限)での性質を調べる(無限大に飛ばす)と、その出力はガウス過程という統計モデルに一致することを示した。
この現象は、深層学習の「非線形・非ガウス的」な見かけとは対照的に、適切なスケーリングのもとではネットワークが線形確率モデルとして振る舞うことを示しており、関数空間上での分布という観点から深層モデルを理解するための基礎となる。
入力 $x \in \mathbb{R}^{d_0}$ に対して、全結合ネットワークを
\[ h^{(l)}(x) = \frac{1}{\sqrt{n_{l-1}}} W^{(l)} \phi\bigl(h^{(l-1)}(x)\bigr) + b^{(l)}, \quad h^{(0)}(x)=x \]
と定義する。ここで、重み $W^{(l)}_{ij}$ とバイアス $b^{(l)}_i$ は独立同分布の確率変数として
\[ W^{(l)}_{ij} \sim \mathcal{N}(0,\sigma_w^2), \quad b^{(l)}_i \sim \mathcal{N}(0,\sigma_b^2) \]
とする。このときネットワーク出力 $f(x) = h^{(L)}(x)$ は、重みのランダム性により「確率過程」として解釈される。
任意の有限個の入力点 $x_1,\dots,x_n$ に対して、出力ベクトル
\[ (f(x_1),\dots,f(x_n)) \]
の分布を考える。幅 $n_l \to \infty$ の極限において、各層の前活性化は多数の独立項の和として表されるため、多変量中心極限定理によりガウス分布に収束する。したがって、有限次元分布がすべてガウス分布となるため、極限において $f$ はガウス過程となる。
NNGPの本質は、その共分散関数(カーネル)が層ごとに再帰的に定義される点にある。初期層において
\[ \Sigma^{(0)}(x,x') = \frac{1}{d_0} x^\top x' \]
とすると、各層において
\[ \Sigma^{(l)}(x,x') = \sigma_w^2 \, \mathbb{E}_{(u,v) \sim \mathcal{N}(0, \Sigma^{(l-1)})}[\phi(u)\phi(v)] + \sigma_b^2 \]
と再帰的に定義される。この $\Sigma^{(L)}$ がNNGPカーネルである。
例えばReLU活性化の場合、この期待値は閉形式で計算でき、いわゆる「アークコサインカーネル」が得られる。
以上より、任意の有限集合に対する分布収束が成り立つため、Kolmogorovの拡張定理により、ネットワーク出力は関数空間上の確率測度としてガウス過程に収束する。すなわち
\[ f \sim \mathcal{GP}(0, \Sigma^{(L)}) \]
が成立する。この結果は「初期化された無限幅ネットワークはガウス過程に等価である」ことを意味する。
NNGPの重要な帰結として、無限幅ネットワークに対するベイズ推論はガウス過程回帰と一致する。すなわち、観測データ $(X,Y)$ に対する事後分布は
\[ f(x) \mid X,Y \sim \mathcal{GP}\bigl(m(x), k(x,x')\bigr) \]
であり、平均関数は
\[ m(x) = k(x,X) k(X,X)^{-1} Y \]
と書ける。これはカーネル法との完全な同値性を示している。
深さを増すと、カーネル再帰 $\Sigma^{(l)}$ はある固定点に収束することがある。このとき、入力間の相関が飽和し、表現能力が低下する(いわゆる「カーネルの退化」)。これは深いNNGPが必ずしも高い表現力を持たないことを示唆する。
この現象は、活性化関数とスケーリングの選択に強く依存し、「エッジ・オブ・カオス」と呼ばれる臨界条件において最も豊かな表現が得られる。
NNGPは「初期化時の関数分布」を記述するのに対し、ニューラルタンジェントカーネル(NTK)は「学習ダイナミクス」を記述する。無限幅極限において、勾配降下法は関数空間での線形ダイナミクスに収束し、
\[ f_t(x) = f_0(x) + K_{\mathrm{NTK}}(x,X)\alpha_t \]
のように表される。このとき関数クラスはRKHSに固定され、特徴学習は起こらない。
現実のニューラルネットワークは有限幅であり、この場合にはNNGPからの逸脱が重要となる。有限幅では:
したがってNNGPは「基準モデル」としての役割を持つが、深層学習の本質を完全に捉えるものではない。
NNGPは関数空間上のガウス測度を与える。この測度はカーネル $\Sigma^{(L)}$ によって完全に特徴づけられ、対応するRKHSはその支持空間となる。したがってNNGPは「どの関数が事前的に高い確率を持つか」を決定する構造として理解される。
NNGPは、無限幅極限においてニューラルネットワークがガウス過程に収束するという厳密な結果であり、深層モデルとカーネル法を結びつける基本的枠組みを提供する。この理論は、関数空間上の確率分布・再帰的カーネル構造・中心極限定理に基づいており、深層学習の一側面を線形理論として理解することを可能にする。一方で、有限幅ネットワークにおける非線形性や特徴学習はこの枠組みを超えるものであり、NNGPはあくまで極限的な理想モデルとして位置づけられる。
Mathematics is the language with which God has written the universe.