勾配降下法と線形化

勾配降下法とは、与えられた損失関数を最小化するために、その勾配(微分)に沿ってパラメータを逐次的に更新していく最適化手法である。直感的には、関数の値が最も急激に減少する方向に少しずつ移動することで、最小値へと到達しようとする反復的手続きである。ニューラルネットワークにおいては、損失関数は予測と教師データとの誤差を測る量として定義され、その勾配は誤差逆伝播法によって効率的に計算される。

このとき通常の理解では、勾配降下法は高次元のパラメータ空間における非線形最適化問題として捉えられる。すなわち、数百万から数億に及ぶ重みパラメータの空間において、複雑な非凸関数を最小化する問題であり、そのダイナミクスは一般に極めて複雑であると考えられている。

しかしながら、ニューラルネットワークの出力はパラメータを通じて定まる関数であるため、学習の本質はパラメータそのものではなく、「関数がどのように変化するか」にある。この観点に立つと、勾配降下法はパラメータ空間の運動ではなく、関数空間における運動として再解釈することが可能となる。

ここで重要な役割を果たすのが「線形化」という概念である。一般にニューラルネットワークは非線形な関数であるが、ある基準点(通常は初期化点)の近傍では、テイラー展開により一次近似をとることができる。このとき、関数はパラメータに関して線形な形で表現される。

通常、このような線形近似は局所的にしか有効ではないが、ネットワークの幅を大きくした極限では、学習中のパラメータの変化が相対的に小さく抑えられるため、この一次近似が学習過程全体にわたって有効となることが知られている。すなわち、非線形モデルであるはずのニューラルネットワークが、学習のダイナミクスに関しては線形モデルとして振る舞うという現象が生じる。

この線形化の意義は、複雑な非線形最適化問題を、解析的に扱いやすい線形力学系へと還元する点にある。すなわち、学習過程はある行列によって支配される指数的収束過程として記述され、その収束速度や方向は固有値構造によって明示的に理解できるようになる。

したがって、勾配降下法と線形化の組み合わせは、ニューラルネットワークの学習を「ブラックボックス的な最適化」から、「構造を持った力学系」へと昇華させる理論的枠組みであり、後に導入されるカーネル構造によってさらに精密に定式化される基盤を提供するものである。

基本設定

本節では、ニューラルネットワークの学習を記述する基本的枠組みとして、勾配降下法とそれに伴う関数の時間発展を定式化する。パラメータ $\theta \in \mathbb{R}^P$ を持つニューラルネットワークを $f(x;\theta)$ とし、訓練データ $(x_i, y_i)_{i=1}^n$ に対して二乗損失

\[ \mathcal{L}(\theta) = \frac{1}{2} \sum_{i=1}^n \bigl(f(x_i;\theta) - y_i\bigr)^2 \]

を最小化する問題を考える。このとき、連続時間極限における勾配降下法(gradient flow)は

\[ \frac{d\theta_t}{dt} = - \nabla_\theta \mathcal{L}(\theta_t) \]

で与えられる。

ここで重要なのは、パラメータの変化そのものではなく、それによって誘導される関数値の変化である。連鎖律により、任意の入力 $x$ に対して

\[ \frac{d}{dt} f(x;\theta_t) = \nabla_\theta f(x;\theta_t)^\top \frac{d\theta_t}{dt} \]

が成立する。

関数空間におけるダイナミクス

損失関数の勾配を代入すると、

\[ \frac{d}{dt} f(x;\theta_t) = - \sum_{i=1}^n (f(x_i;\theta_t) - y_i)\, \nabla_\theta f(x;\theta_t)^\top \nabla_\theta f(x_i;\theta_t) \]

が得られる。この式は、関数の時間発展が、各訓練点における誤差と勾配ベクトルの相関によって決定されることを示している。

特に、訓練点上での関数値ベクトル

\[ f_t = (f(x_1;\theta_t), \dots, f(x_n;\theta_t)) \]

を考えると、その時間発展は

\[ \frac{d}{dt} f_t = - A_t (f_t - y) \]

という形の常微分方程式に従う。ここで $A_t$ は、勾配の内積構造によって定まる対称行列であり、一般には時間とともに変化する。

線形化の導入

上記のダイナミクスは一般には非線形であるが、重要な近似として「線形化」が導入される。これは、関数 $f(x;\theta)$ を初期パラメータ $\theta_0$ の近傍でテイラー展開することにより得られる:

\[ f(x;\theta) \approx f(x;\theta_0) + \nabla_\theta f(x;\theta_0)^\top (\theta - \theta_0) \]

この近似により、モデルはパラメータに関して線形となり、勾配降下法による学習は線形モデルの最適化と同型となる。その結果、関数の時間発展は

\[ \frac{d}{dt} f_t \approx - A_0 (f_t - y) \]

という線形微分方程式で記述される。

無限幅極限と線形化の妥当性

この線形化が単なる局所近似にとどまらず、学習全体にわたって有効となる条件が重要である。ニューラルネットワークの各層の幅を無限大にした極限では、確率的な集中現象により、パラメータの変化量は相対的に小さく抑えられ、

\[ A_t \approx A_0 \]

が成立する。この結果、高次の非線形項は無視でき、一次近似が実質的に厳密化される。

したがって、学習ダイナミクスは初期値に依存する固定行列によって完全に支配される線形系となる。

ダイナミクスの解釈

線形化されたダイナミクスは、初期関数 $f_0$ から教師信号 $y$ に向かって指数的に収束する過程として理解される。このとき収束速度や方向は行列 $A_0$ の固有値構造によって決定される。

すなわち、固有値の大きい方向では誤差が速く減衰し、小さい方向ではゆっくりとしか学習が進まない。この構造は、ニューラルネットワークが特定の関数成分を優先的に学習するという性質を示唆している。

まとめ

勾配降下法と線形化の観点は、ニューラルネットワークの学習を、パラメータ空間における非線形最適化から、関数空間における線形ダイナミクスへと再解釈するものである。特に無限幅極限では、関数の一次近似が学習全体にわたって有効となり、ダイナミクスは固定された行列によって支配される線形系に簡約される。この構造は、次節で導入されるカーネル概念によって厳密に定式化され、ニューラルネットワークの学習理論の基盤を与える。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習