学習基底としてのニューラルネットワーク(Neural Network as Learned Basis)は、ニューラルネットワークを関数近似の基底関数システムとして捉える統一的な視点であり、固定基底(カーネル・スプライン)との本質的な差異である「基底そのものの学習」を関数解析・統計学習理論・最適化理論の言語で厳密に定式化する枠組みである。転移学習・表現学習・メタ学習・連続学習などの現代的な深層学習の理論的基盤を提供する。
入力空間 $\mathcal{X} \subseteq \mathbb{R}^d$、出力空間 $\mathcal{Y}$、i.i.d. 標本 $\mathcal{D}_n = \{(\boldsymbol{x}_i, y_i)\}_{i=1}^n \sim P^n$、分布の族 $\{P_\tau\}_{\tau \in \mathcal{T}}$(タスクの分布族)を考える。$L$ 層ニューラルネットワークのパラメータを$\boldsymbol{\theta} = (\boldsymbol{\phi}, \boldsymbol{w})$と分割する:
\[f_{\boldsymbol{\theta}}(\boldsymbol{x})= \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})\]ここで $\boldsymbol{h}_{\boldsymbol{\phi}}: \mathcal{X} \to \mathbb{R}^m$は特徴抽出器(Feature Extractor)またはエンコーダであり、パラメータ $\boldsymbol{\phi}$(表現パラメータ、Representation Parameters)が学習基底 $\{\phi_j^{\boldsymbol{\phi}}(\cdot) = [h_{\boldsymbol{\phi}}(\cdot)]_j\}_{j=1}^m$ を定義する。$\boldsymbol{w} \in \mathbb{R}^m$(読み出しパラメータ、Readout Parameters)は基底の線形結合係数である。固定基底モデルでは $\boldsymbol{\phi}$ が定数(基底が固定)であり、学習基底モデルでは $\boldsymbol{\phi}$ がデータから最適化される。
固定カーネル $k$ による RKHS $\mathcal{H}_k$ では、関数クラスは固定された正定値カーネルによって完全に規定される:
\[\mathcal{H}_k = \left\{f = \sum_j c_j\varphi_j : \sum_j \frac{c_j^2}{\lambda_j} < \infty\right\}\]($\varphi_j, \lambda_j$:カーネルの固有関数・固有値)。一方ニューラルネットワークが定義する関数クラスはパラメータ $\boldsymbol{\phi}$ に依存した適応的関数空間であり、
\[\mathcal{F}_{\boldsymbol{\phi}}= \left\{f(\boldsymbol{x}) = \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}) :\boldsymbol{w} \in \mathbb{R}^m\right\}\]と書ける。$\boldsymbol{\phi}$ の変化により関数空間 $\mathcal{F}_{\boldsymbol{\phi}}$ 自体が変形し、データに最適化された関数クラスが動的に構築される。この「関数空間の適応的変形」が学習基底の本質である。
学習基底によって誘導される適応的カーネルは
\[k_{\boldsymbol{\phi}}(\boldsymbol{x}, \boldsymbol{x}')= \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}')= \sum_{j=1}^m h_{\boldsymbol{\phi},j}(\boldsymbol{x}) h_{\boldsymbol{\phi},j}(\boldsymbol{x}')\]と定義される。$k_{\boldsymbol{\phi}}$ は $\boldsymbol{\phi}$ の学習とともに変化するデータ依存的な正定値カーネルであり、NTK(ニューラルタンジェントカーネル)は $k_{\boldsymbol{\phi}}$ の特殊なインスタンスとして解釈できる。
学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ は以下の性質を達成することが理想とされる。
学習基底の最適化は自然に二段階の問題として分解できる。
外側問題(基底の学習):基底パラメータ $\boldsymbol{\phi}$ を最適化し、良い特徴表現を構築する:
\[\min_{\boldsymbol{\phi}}\mathcal{L}_{\mathrm{repr}}(\boldsymbol{\phi}; \mathcal{D}_n)\quad \text{s.t.} \quad\boldsymbol{h}_{\boldsymbol{\phi}} \text{ が汎化可能な基底を定義}\]内側問題(係数の学習):固定された基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ のもとで係数 $\boldsymbol{w}$ を最適化する(線形モデルの学習):
\[\min_{\boldsymbol{w} \in \mathbb{R}^m}\frac{1}{n}\sum_{i=1}^n \ell(y_i, \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i))+ \lambda\|\boldsymbol{w}\|^2\]内側問題は固定基底の正則化線形回帰(凸問題)として閉形式で解ける:$\hat{\boldsymbol{w}} = (H_{\boldsymbol{\phi}}^\top H_{\boldsymbol{\phi}} + n\lambda I)^{-1}H_{\boldsymbol{\phi}}^\top \boldsymbol{y}$($H_{\boldsymbol{\phi}} = [\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i)]_{i=1}^n \in \mathbb{R}^{n \times m}$)。または $\hat{\boldsymbol{w}} = H_{\boldsymbol{\phi}}^\top(H_{\boldsymbol{\phi}}H_{\boldsymbol{\phi}}^\top + n\lambda I)^{-1}\boldsymbol{y}$という双対形式($m > n$ のとき効率的)でも計算できる。
実際には $\boldsymbol{\phi}$ と $\boldsymbol{w}$ を同時に最適化する合同最適化(Joint Optimization)が行われる:
\[\min_{\boldsymbol{\phi}, \boldsymbol{w}}\frac{1}{n}\sum_{i=1}^n \ell(y_i, \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i))+ \lambda_1\|\boldsymbol{w}\|^2 + \lambda_2 R(\boldsymbol{\phi})\]ここで $R(\boldsymbol{\phi})$ は基底パラメータへの正則化項。合同最適化における根本的な課題として特徴崩壊(Feature Collapse)がある:$\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}) \equiv \boldsymbol{0}$(定数写像)やランク欠損の表現(すべての入力が同一の特徴に写像される)が損失をゼロにする自明解として存在する。この崩壊を防ぐための設計原理として以下が重要である:
転移学習(Transfer Learning)は学習基底の最も重要な応用であり、大規模なソースタスク $\mathcal{D}_{\mathrm{src}}$ で学習した基底 $\boldsymbol{h}_{\hat{\boldsymbol{\phi}}}$ を小規模なターゲットタスク $\mathcal{D}_{\mathrm{tgt}}$ に転用する。
事前学習(Pretraining):ソースデータで基底パラメータを最適化する:
\[\hat{\boldsymbol{\phi}} = \arg\min_{\boldsymbol{\phi}}\frac{1}{|\mathcal{D}_{\mathrm{src}}|}\sum_{(\boldsymbol{x},y) \in \mathcal{D}_{\mathrm{src}}}\ell_{\mathrm{src}}(y, f_{\boldsymbol{\phi},\boldsymbol{w}}(\boldsymbol{x}))\]微調整(Fine-tuning):学習済み基底 $\boldsymbol{h}_{\hat{\boldsymbol{\phi}}}$ を初期値としてターゲットデータで更新する:
\[(\hat{\boldsymbol{\phi}}', \hat{\boldsymbol{w}}')= \arg\min_{\boldsymbol{\phi}, \boldsymbol{w}}\frac{1}{|\mathcal{D}_{\mathrm{tgt}}|}\sum_{(\boldsymbol{x},y) \in \mathcal{D}_{\mathrm{tgt}}}\ell_{\mathrm{tgt}}(y, \boldsymbol{w}^\top\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}))+ \lambda_{\boldsymbol{\phi}}\|\boldsymbol{\phi} - \hat{\boldsymbol{\phi}}\|^2\]正則化項 $\lambda_{\boldsymbol{\phi}}\|\boldsymbol{\phi} - \hat{\boldsymbol{\phi}}\|^2$ は微調整中に事前学習済み基底から過度に逸脱しないよう制約する(L2-SP;Li et al., 2018)。線形評価プロトコル(Linear Evaluation Protocol)では$\boldsymbol{\phi}$ を完全に固定し $\boldsymbol{w}$ のみを最適化することで基底の質を評価する:良い基底は固定したままでも高い性能を示す。
基底の転移可能性を理論的に評価する指標として、ソースタスクとターゲットタスクの関係を以下のように定量化する。
H-乖離(H-divergence):ドメイン適応(Domain Adaptation)の文脈で、ソースドメイン $P_s$ とターゲットドメイン $P_t$ の乖離を
\[d_{\mathcal{H}}(P_s, P_t)= 2\sup_{h \in \mathcal{H}}\left|P_s(h(\boldsymbol{x})=1) - P_t(h(\boldsymbol{x})=1)\right|\]と定義する。Ben-David et al.(2010)の境界はターゲットドメインでの汎化誤差を
\[\epsilon_t(\hat{h})\leq \epsilon_s(\hat{h})+ \frac{1}{2}d_{\mathcal{H}}(P_s, P_t)+ \lambda^*\]と上界する($\epsilon_s$:ソースドメイン誤差、$\lambda^*$:理想的な共有仮説の誤差)。学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ が誘導する特徴空間で$d_{\mathcal{H}}$ が小さいとき転移が成功しやすい。
ラベルなし大規模データから汎化可能な基底を学習する自己教師あり学習(Self-Supervised Learning, SSL)は、学習基底の実用的な構築法として最も成功している枠組みである。SSL は人工的なラベル(疑似ラベル、Pseudo-labels)を自動生成し、補助タスクを通じて汎化可能な特徴表現を学習する。
対照学習(Contrastive Learning)は同一データの異なる拡張(正例ペア)を特徴空間で近づけ、異なるデータの拡張(負例ペア)を遠ざけることで特徴崩壊を防ぎながら有用な基底を学習する。
SimCLR(Chen et al., 2020)の損失関数は$N$ 個のデータ点それぞれに対して二種類の拡張$\tilde{\boldsymbol{x}} = t(\boldsymbol{x})$、$\tilde{\boldsymbol{x}}' = t'(\boldsymbol{x})$($t, t' \sim \mathcal{T}$)を生成し、正例ペア $(\tilde{\boldsymbol{x}}_i, \tilde{\boldsymbol{x}}_i')$ の類似度を最大化するNT-Xent 損失(Normalized Temperature-scaled Cross Entropy)として
\[\mathcal{L}_{\mathrm{SimCLR}}= -\frac{1}{N}\sum_{i=1}^N\log\frac{\exp\!\left(\mathrm{sim}(\boldsymbol{z}_i, \boldsymbol{z}_i')/\tau\right)}{\sum_{j=1}^N \mathbf{1}[j \neq i] \exp\!\left(\mathrm{sim}(\boldsymbol{z}_i, \boldsymbol{z}_j')/\tau\right)}\]と定義される($\boldsymbol{z}_i = g(h_{\boldsymbol{\phi}}(\tilde{\boldsymbol{x}}_i))$:投影ヘッド適用後の表現、$\mathrm{sim}(\boldsymbol{u},\boldsymbol{v}) = \boldsymbol{u}^\top\boldsymbol{v}/(\|\boldsymbol{u}\|\|\boldsymbol{v}\|)$:コサイン類似度、$\tau > 0$:温度パラメータ)。分母の負例集合には同一ミニバッチ内の $2(N-1)$ 個のペアが使用される。
対照学習の目標は相互情報量の下限最大化として理解できる(Wang–Isola, 2020):
\[\mathcal{L}_{\mathrm{SimCLR}} \approx-I(\boldsymbol{z}; \boldsymbol{z}') + \text{const.}\]ここで $\boldsymbol{z}$ と $\boldsymbol{z}'$ は同一データの異なる拡張から得られた表現である。相互情報量の最大化は「拡張に不変な情報を抽出する」という不変表現学習の目標と対応する。
対照学習の変種は特徴崩壊の防止機構によって分類できる:
MAE(Masked Autoencoder;He et al., 2022)は入力の大部分(典型的に 75\%)をマスクし、可視パッチのみを入力として受け取るエンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}$ とマスクされたパッチを復元するデコーダ $g_{\boldsymbol{\psi}}$ の組み合わせで学習する:
\[\mathcal{L}_{\mathrm{MAE}}= \frac{1}{|\mathcal{M}|}\sum_{j \in \mathcal{M}}\|g_{\boldsymbol{\psi}}(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_{\mathcal{V}}))_j - \boldsymbol{x}_j\|^2\]($\mathcal{M}$:マスクされたパッチの集合、$\mathcal{V}$:可視パッチの集合)。高マスク率が非自明な再構成タスクを生み出し、局所的なテクスチャに依存しない大域的な意味的特徴を基底として学習させる。
CLIP(Contrastive Language-Image Pretraining;Radford et al., 2021)は画像エンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}^{\mathrm{img}}$ とテキストエンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}^{\mathrm{txt}}$ を画像-テキストペアの対照学習で同時に学習する:
\[\mathcal{L}_{\mathrm{CLIP}}= -\frac{1}{N}\sum_{i=1}^N\left[\log\frac{e^{\boldsymbol{z}_i^{\mathrm{img}\top}\boldsymbol{z}_i^{\mathrm{txt}}/\tau}} {\sum_j e^{\boldsymbol{z}_i^{\mathrm{img}\top}\boldsymbol{z}_j^{\mathrm{txt}}/\tau}}+\log\frac{e^{\boldsymbol{z}_i^{\mathrm{txt}\top}\boldsymbol{z}_i^{\mathrm{img}}/\tau}} {\sum_j e^{\boldsymbol{z}_i^{\mathrm{txt}\top}\boldsymbol{z}_j^{\mathrm{img}}/\tau}}\right]\]CLIP の基底は画像とテキストの共通意味空間を定義し、ゼロショット分類(テキストプロンプトによる新クラスの識別)を可能にする。これは「基底が言語的概念と整合した多モーダル空間を構築する」という学習基底の最も洗練された実例である。
メタ学習(Meta-Learning、Learning to Learn)は複数のタスク $\{\mathcal{T}_\tau\}_{\tau \in \mathcal{T}}$ からタスクを横断して汎化できる基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ を学習する枠組みである。各タスク $\mathcal{T}_\tau$ は小規模な訓練集合(サポートセット)$\mathcal{S}_\tau = \{(\boldsymbol{x}_i, y_i)\}_{i=1}^{K}$ と評価集合(クエリセット)$\mathcal{Q}_\tau$ から構成される$N$-way $K$-shot 問題として定式化される。
MAML(Model-Agnostic Meta-Learning;Finn et al., 2017)は「少ステップの勾配降下で新タスクに適応できる初期パラメータ」を求める二段階最適化として定式化される:
\[\min_{\boldsymbol{\phi}}\mathbb{E}_{\tau \sim p(\mathcal{T})}\mathcal{L}_{\mathcal{Q}_\tau}\!\left(f_{\boldsymbol{\phi} - \alpha\nabla_{\boldsymbol{\phi}}\mathcal{L}_{\mathcal{S}_\tau}(f_{\boldsymbol{\phi}})}\right)\]内側更新 $\boldsymbol{\phi}_\tau' = \boldsymbol{\phi} - \alpha\nabla_{\boldsymbol{\phi}}\mathcal{L}_{\mathcal{S}_\tau}$は各タスクへの高速適応であり、外側更新はクエリセット上の損失を通じて高速適応を可能にする初期値 $\boldsymbol{\phi}$ を最適化する。MAML の外側更新には Hessian(二階微分)が必要であり、一階近似(FOMAML)または効率的な実装(Reptile;Nichol et al., 2018)が実用上用いられる。
学習基底の観点から MAML を解釈すると、$\boldsymbol{\phi}$ は「タスクに共通な表現空間の初期値」として機能し、各タスクの適応は $\boldsymbol{\phi}$ の近傍でのファインチューニングとして実現される。MAML が学習するのは「良い初期化点としての基底」であり、タスク特異な情報は適応ステップで追加される。
プロトタイプネットワーク(Prototypical Networks;Snell et al., 2017)は学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ の質をクラスプロトタイプ(クラス内特徴の平均)との距離で評価する:
\[\boldsymbol{c}_k = \frac{1}{|\mathcal{S}_k|}\sum_{(\boldsymbol{x},y) \in \mathcal{S}_k} \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}),\qquad p(y=k \mid \boldsymbol{x}) = \frac{\exp(-d(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}), \boldsymbol{c}_k))}{\sum_j \exp(-d(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}), \boldsymbol{c}_j))}\]($d$:ユークリッド距離またはコサイン距離)。プロトタイプネットワークは学習基底が「同クラスの点が特徴空間でクラスタ化される」という性質を持つよう訓練され、少数例($K$-shot)での分類において優れた性能を示す。
過剰パラメータ化($|\boldsymbol{\theta}| \gg n$)のニューラルネットワークにおいて、SGD による訓練は陽な正則化なしで汎化する解を発見する。この現象の理論的説明として、勾配降下法がパラメータ空間での最小ノルム解$\hat{\boldsymbol{\theta}} = \arg\min_{\boldsymbol{\theta}} \|\boldsymbol{\theta}\|$s.t. $f_{\boldsymbol{\theta}}(\boldsymbol{x}_i) = y_i$($\forall i$)に近い解を選択するという暗黙の正則化(Implicit Regularization)仮説がある。
線形ネットワーク($f_{\boldsymbol{\theta}}(\boldsymbol{x}) = W_L\cdots W_1\boldsymbol{x}$)に対して、深さ $L$ の行列積の最小ノルム補間解は正規化行列積のバランス条件$W_\ell^\top W_\ell = W_{\ell+1}W_{\ell+1}^\top$($\forall \ell$)を満たす解に収束することが理論的に示されており(Arora et al., 2019)、この解は行列の核ノルム(Nuclear Norm)最小化問題の解に漸近的に一致する。核ノルム最小化は低ランク行列近似の凸緩和であるため、深い線形ネットワークは「暗黙の低ランク正則化」を行っていると解釈できる。
ニューラルスケーリング則(Neural Scaling Laws;Kaplan et al., 2020)は過剰パラメータ化体制での基底学習の定量的な法則として、モデルサイズ $N$・データ数 $D$・計算量 $C$ とテスト損失 $\mathcal{L}$ の間の冪乗則
\[\mathcal{L}(N) \propto N^{-\alpha_N},\quad\mathcal{L}(D) \propto D^{-\alpha_D},\quad\mathcal{L}(C) \propto C^{-\alpha_C}\]を示す(典型的に $\alpha_N \approx 0.07$、$\alpha_D \approx 0.10$、$\alpha_C \approx 0.05$for 言語モデル)。スケーリング則は「より大きなモデルはより良い基底を学習する」という経験的法則を定量化し、過剰パラメータ化体制での基底品質の向上を予測する。Chinchilla スケーリング則(Hoffmann et al., 2022)では最適なモデルサイズとデータ数の比が $N \propto D$ であることが示されており、「基底学習の効率」の観点から事前学習の設計指針を与える。
連続学習(Continual Learning)ではタスク $\mathcal{T}_1 \to \mathcal{T}_2 \to \cdots$ を順次学習する際に、新タスクの学習が旧タスクの基底を上書きする破滅的忘却(Catastrophic Forgetting;McCloskey–Cohen, 1989)が生じる。学習基底の観点からは、新タスク用に $\boldsymbol{\phi}$ を更新すると旧タスクに有用だった基底関数が失われる問題である。
対策として以下のアプローチが提案されている:
学習された基底関数 $\phi_j^{\boldsymbol{\phi}}(\boldsymbol{x}) = [\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})]_j$の解釈可能性は実用的に重要な問題である。以下の技法が基底の解釈に用いられる:
訓練後の特徴空間における幾何学的構造を分析することで学習基底の品質を評価できる。
学習基底としてのニューラルネットワークを統一的に理解する理論的枠組みを整理する。
| 理論的枠組み | 学習基底への含意 | 主要な結果 |
|---|---|---|
| NTK 理論 | 無限幅では基底が固定(特徴学習なし)。有限幅での特徴学習が適応的基底の本質。 | $\Theta(\boldsymbol{x},\boldsymbol{x}') = \langle\nabla_{\boldsymbol{\theta}}f,\nabla_{\boldsymbol{\theta}}f'\rangle$が訓練中定数化。 |
| Mean Field 理論 | 深さ・幅・活性化関数が基底の統計的性質(平均・分散の伝播)を規定。 | Edge of Chaos(混沌の縁)での初期化が信号伝播の最適化と相関。 |
| 情報ボトルネック | 基底が $I(\boldsymbol{h};Y)$ を最大化しつつ$I(\boldsymbol{h};\boldsymbol{X})$ を最小化する圧縮を達成。 | 訓練後期に圧縮フェーズが生じるという仮説(実験的検証は議論中)。 |
| スケーリング則 | モデルサイズ・データ・計算の冪乗則により基底の品質向上を予測・設計できる。 | $\mathcal{L} \propto N^{-\alpha}$。Chinchilla 則による最適スケーリング。 |
| 相互情報量最大化 | 対照学習は入力の異なるビュー間の相互情報量下限を最大化。 | $\mathcal{L}_{\mathrm{InfoNCE}} \geq -\log N + I(\boldsymbol{z};\boldsymbol{z}')$。 |
| ドメイン適応理論 | 転移可能な基底は H-乖離を最小化する特徴空間を構築する。 | $\epsilon_t \leq \epsilon_s + d_{\mathcal{H}}/2 + \lambda^*$。 |
学習基底としてのニューラルネットワークは、固定された係数の最適化(固定基底モデル)を超えて基底関数そのものをデータから最適化することで合成関数構造の利用・次元の呪いの部分的回避・タスク横断的汎化を実現する。特徴抽出器 $\boldsymbol{h}_{\boldsymbol{\phi}}$ と読み出しパラメータ $\boldsymbol{w}$ の分離は基底学習と係数学習の二段階最適化として定式化され、線形評価プロトコルがその品質評価の標準的手段となる。自己教師あり学習(SimCLR・BYOL・Barlow Twins・MAE・CLIP)はラベルなしデータから汎化可能な基底を学習する実用的枠組みを提供し、崩壊防止機構の設計が理論的・実践的に重要な課題となる。メタ学習(MAML・プロトタイプネットワーク)はタスク横断的な基底学習を通じて少数例適応を実現し、連続学習では EWC・漸進的ネットワーク・プロジェクション法が破滅的忘却への対策として基底の安定性を保護する。NTK 理論は無限幅での固定基底への等価性を示し、有限幅での特徴学習が適応的基底の本質であることを浮き彫りにする。スケーリング則は過剰パラメータ化体制での基底品質の冪乗的向上を定量化し、大規模事前学習モデルの設計指針を与える。均一性・整合性・CKA などの幾何学的評価指標は学習基底の品質を特徴空間の構造から定量化し、転移可能性・解釈可能性の理論的理解を深める。これらを統合した「学習基底としての NN」の視点は統計的学習理論・関数解析・情報理論・最適化理論を横断する現代深層学習の統一的理解の核心をなす。
Mathematics is the language with which God has written the universe.