Lazy Training(遅延学習)とFeature Learning(特徴学習)

ニューラルネットワークの学習は、一見すると単一の枠組みによって記述されるように見えるが、その実態は大きく二つの異なるレジームに分かれることが知られている。それが、Lazy Training(遅延学習)とFeature Learning(特徴学習)である。これらは単なる挙動の違いではなく、学習が「何を変化させているのか」という本質的な問いに対する異なる答えを与える概念である。

Lazy Trainingとは、学習過程においてパラメータの変化が極めて小さく、ネットワークの振る舞いが初期化点の近傍に留まり続ける状況を指す。このとき、ネットワークの出力関数は初期状態のまわりでほぼ線形に変化し、実質的には初期に定まった特徴表現を固定したまま、その線形結合のみを調整していると解釈できる。したがって、学習の本質は新たな表現を獲得することではなく、既存の特徴に対する重み付けを最適化することにある。

これに対してFeature Learningとは、学習の過程でパラメータが大きく変化し、ネットワーク内部の表現そのものが動的に変形されるレジームを指す。この場合、各層における特徴抽出は固定されておらず、データに適応して逐次的に再構成される。その結果、入力空間の幾何構造や重要な変数の組み合わせが学習によって発見され、より適切な表現空間が構築される。

この二つのレジームの違いは、単にパラメータの変化量の大小にとどまらない。Lazy Trainingでは、モデルは初期化時に暗黙的に定められた関数空間(カーネルによって特徴づけられる)に制約され、その内部で最適な関数を選択する。一方、Feature Learningでは、その関数空間自体が学習とともに変形されるため、より柔軟で適応的な表現が可能となる。

理論的には、ネットワークの幅を無限大にした極限ではLazy Trainingが支配的となり、学習ダイナミクスは線形化される。一方、有限幅のネットワークでは、パラメータの変化が無視できず、Feature Learningが重要な役割を果たす。この意味で、両者は連続的なスペクトラムの両端に位置する概念であり、実際の深層学習はその中間に位置する場合が多い。

したがって、Lazy TrainingとFeature Learningの区別は、ニューラルネットワークの表現能力や一般化性能を理解するうえで不可欠であり、どのような条件のもとでどちらのレジームが支配的となるのかを明らかにすることが、現代の深層学習理論における重要な課題となっている。

基本設定

本節では、ニューラルネットワークの学習ダイナミクスを記述する枠組みとして、Lazy TrainingとFeature Learningの双方を統一的に扱うための基本設定を導入する。パラメータ $\theta \in \mathbb{R}^P$ を持つニューラルネットワーク $f(x;\theta)$ を考え、訓練データ $(x_i, y_i)_{i=1}^n$ に対する二乗損失

\[\mathcal{L}(\theta) = \frac{1}{2} \sum_{i=1}^n \bigl(f(x_i;\theta) - y_i\bigr)^2\]

を最小化する問題を考える。勾配降下法の連続時間極限は

\[\frac{d\theta_t}{dt} = - \nabla_\theta \mathcal{L}(\theta_t)\]

で与えられる。

このとき、関数値の時間発展は連鎖律により

\[\frac{d}{dt} f(x;\theta_t) = \nabla_\theta f(x;\theta_t)^\top \frac{d\theta_t}{dt}\]

と書ける。損失関数の勾配を代入すると、

\[\frac{d}{dt} f(x;\theta_t) = - \sum_{i=1}^n (f(x_i;\theta_t) - y_i)\, \nabla_\theta f(x;\theta_t)^\top \nabla_\theta f(x_i;\theta_t)\]

が得られる。

特に、訓練点上での関数値ベクトル $f_t = (f(x_1;\theta_t), \dots, f(x_n;\theta_t))$ を考えると、その時間発展は

\[\frac{d}{dt} f_t = - A_t (f_t - y)\]

という形の常微分方程式に従う。ここで $A_t$ は勾配の内積によって定まる対称行列であり、一般には時間とともに変化する。この行列の振る舞い、すなわち学習中にほぼ一定に保たれるか、それとも大きく変化するかが、Lazy TrainingとFeature Learningを分ける本質的な要因となる。

Lazy Trainingの数理的特徴

Lazy Trainingのレジームでは、学習過程においてパラメータの変化が初期値の近傍に制限される。すなわち、$\|\theta_t - \theta_0\|$ が小さいまま推移し、その結果として関数 $f(x;\theta)$ は初期点のまわりでの一次近似によって十分に記述される。このとき

\[f(x;\theta_t) \approx f(x;\theta_0) + \nabla_\theta f(x;\theta_0)^\top (\theta_t - \theta_0)\]

が成立し、モデルはパラメータに関して線形となる。

この近似のもとでは、前節で導入した行列 $A_t$ は時間に対してほとんど変化せず、$A_t \approx A_0$ が成立する。したがって、関数の時間発展は

\[\frac{d}{dt} f_t \approx - A_0 (f_t - y)\]

という線形微分方程式で記述される。この結果、学習は初期関数 $f_0$ から教師信号 $y$ に向かって指数的に収束する単純な緩和過程となる。

このレジームの本質は、特徴表現が固定されている点にある。すなわち、$\nabla_\theta f(x;\theta_0)$ によって張られる特徴空間は学習中に変化せず、その空間内での線形結合のみが調整される。したがって、モデルの表現能力は初期化時点でほぼ決定されており、学習はその中での最適化に過ぎない。

Feature Learningの数理的特徴

これに対してFeature Learningのレジームでは、パラメータの変化が無視できず、$\theta_t$ は初期値から大きく離れる。このとき、関数の一次近似はもはや有効ではなく、高次の非線形項が支配的となる。したがって、

\[f(x;\theta_t) \not\approx f(x;\theta_0) + \nabla_\theta f(x;\theta_0)^\top (\theta_t - \theta_0)\]

となり、モデルは本質的に非線形なダイナミクスを示す。

この状況では、行列 $A_t$ も時間とともに大きく変化し、

\[A_t \neq A_0\]

となる。すなわち、関数の時間発展は

\[\frac{d}{dt} f_t = - A_t (f_t - y)\]

という非線形な力学系として振る舞う。このとき、単に出力が変化するだけでなく、入力に対する応答構造そのものが変形される。

このレジームの本質は、特徴表現が学習によって動的に更新される点にある。すなわち、$\nabla_\theta f(x;\theta_t)$ によって定まる特徴空間そのものが時間とともに変化し、データに適応した新たな表現が構築される。この過程により、入力空間の幾何構造が再編成され、重要な方向や変数の組み合わせが強調される。

両者の関係と遷移

Lazy TrainingとFeature Learningは対立する概念ではなく、同一の枠組みにおける異なる極限として理解される。ネットワークの幅が非常に大きい場合や初期化スケールが適切に選ばれた場合には、パラメータの変化は小さく抑えられ、Lazy Trainingが支配的となる。一方、幅が有限であったり、学習率や初期化が異なる場合には、Feature Learningが顕著に現れる。

この観点からは、学習ダイナミクスの本質は「特徴空間が固定されているか、あるいは進化するか」という点に集約される。前者では学習は既存の関数空間内での最適化に還元され、後者では関数空間そのものが変形されるため、より高い適応能力が発揮される。

まとめ

Lazy TrainingとFeature Learningは、ニューラルネットワークの学習を理解するための二つの基本的レジームであり、前者は線形化されたダイナミクスに対応し、後者は非線形な特徴変換の進化を伴う。これらの違いは、パラメータ変化の大きさと、それに伴う特徴表現の変化に起因するものであり、ネットワークの幅や初期化、学習率などの条件によって決定される。したがって、両者の関係を明確にすることは、深層学習における表現能力と一般化性能の理解において本質的な意義を持つ。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習