学習基底としてのNN

学習基底としてのニューラルネットワーク(Neural Network as Learned Basis)は、ニューラルネットワークを関数近似の基底関数システムとして捉える統一的な視点であり、固定基底(カーネル・スプライン)との本質的な差異である「基底そのものの学習」を関数解析・統計学習理論・最適化理論の言語で厳密に定式化する枠組みである。転移学習・表現学習・メタ学習・連続学習などの現代的な深層学習の理論的基盤を提供する。

設定

入力空間 $\mathcal{X} \subseteq \mathbb{R}^d$、出力空間 $\mathcal{Y}$、i.i.d. 標本 $\mathcal{D}_n = \{(\boldsymbol{x}_i, y_i)\}_{i=1}^n \sim P^n$、分布の族 $\{P_\tau\}_{\tau \in \mathcal{T}}$(タスクの分布族)を考える。$L$ 層ニューラルネットワークのパラメータを$\boldsymbol{\theta} = (\boldsymbol{\phi}, \boldsymbol{w})$と分割する:

\[f_{\boldsymbol{\theta}}(\boldsymbol{x})= \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})\]

ここで $\boldsymbol{h}_{\boldsymbol{\phi}}: \mathcal{X} \to \mathbb{R}^m$は特徴抽出器(Feature Extractor)またはエンコーダであり、パラメータ $\boldsymbol{\phi}$(表現パラメータ、Representation Parameters)が学習基底 $\{\phi_j^{\boldsymbol{\phi}}(\cdot) = [h_{\boldsymbol{\phi}}(\cdot)]_j\}_{j=1}^m$ を定義する。$\boldsymbol{w} \in \mathbb{R}^m$(読み出しパラメータ、Readout Parameters)は基底の線形結合係数である。固定基底モデルでは $\boldsymbol{\phi}$ が定数(基底が固定)であり、学習基底モデルでは $\boldsymbol{\phi}$ がデータから最適化される。

学習基底の関数解析的定式化

適応的関数空間としての RKHS との対比

固定カーネル $k$ による RKHS $\mathcal{H}_k$ では、関数クラスは固定された正定値カーネルによって完全に規定される:

\[\mathcal{H}_k = \left\{f = \sum_j c_j\varphi_j : \sum_j \frac{c_j^2}{\lambda_j} < \infty\right\}\]

($\varphi_j, \lambda_j$:カーネルの固有関数・固有値)。一方ニューラルネットワークが定義する関数クラスはパラメータ $\boldsymbol{\phi}$ に依存した適応的関数空間であり、

\[\mathcal{F}_{\boldsymbol{\phi}}= \left\{f(\boldsymbol{x}) = \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}) :\boldsymbol{w} \in \mathbb{R}^m\right\}\]

と書ける。$\boldsymbol{\phi}$ の変化により関数空間 $\mathcal{F}_{\boldsymbol{\phi}}$ 自体が変形し、データに最適化された関数クラスが動的に構築される。この「関数空間の適応的変形」が学習基底の本質である。

学習基底によって誘導される適応的カーネルは

\[k_{\boldsymbol{\phi}}(\boldsymbol{x}, \boldsymbol{x}')= \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}')= \sum_{j=1}^m h_{\boldsymbol{\phi},j}(\boldsymbol{x}) h_{\boldsymbol{\phi},j}(\boldsymbol{x}')\]

と定義される。$k_{\boldsymbol{\phi}}$ は $\boldsymbol{\phi}$ の学習とともに変化するデータ依存的な正定値カーネルであり、NTK(ニューラルタンジェントカーネル)は $k_{\boldsymbol{\phi}}$ の特殊なインスタンスとして解釈できる。

特徴写像の学習と不変表現

学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ は以下の性質を達成することが理想とされる。

  • 情報保存性:$\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})$ が $y$ を予測するために必要な情報をすべて保持する:$I(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{X}); Y) \approx I(\boldsymbol{X}; Y)$。
  • タスク関連性:$y$ の予測に不要な入力の変動(ノイズ・無関係な変換)が除去される:$I(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{X}); \boldsymbol{X}) \approx I(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{X}); Y)$(情報ボトルネック原理との接続)。
  • 不変性:タスクに無関係な変換群 $\mathcal{G}$(回転・並進・スケール等)に対して$\boldsymbol{h}_{\boldsymbol{\phi}}(g \cdot \boldsymbol{x}) \approx \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})$が成立する(等変性・不変性)。
  • 汎化可能性:$\boldsymbol{h}_{\boldsymbol{\phi}}$ が新しいタスク・ドメインに対して少ない追加学習で適応できる(転移可能性)。

学習基底の最適化問題の分解

二段階最適化

学習基底の最適化は自然に二段階の問題として分解できる。

外側問題(基底の学習):基底パラメータ $\boldsymbol{\phi}$ を最適化し、良い特徴表現を構築する:

\[\min_{\boldsymbol{\phi}}\mathcal{L}_{\mathrm{repr}}(\boldsymbol{\phi}; \mathcal{D}_n)\quad \text{s.t.} \quad\boldsymbol{h}_{\boldsymbol{\phi}} \text{ が汎化可能な基底を定義}\]

内側問題(係数の学習):固定された基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ のもとで係数 $\boldsymbol{w}$ を最適化する(線形モデルの学習):

\[\min_{\boldsymbol{w} \in \mathbb{R}^m}\frac{1}{n}\sum_{i=1}^n \ell(y_i, \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i))+ \lambda\|\boldsymbol{w}\|^2\]

内側問題は固定基底の正則化線形回帰(凸問題)として閉形式で解ける:$\hat{\boldsymbol{w}} = (H_{\boldsymbol{\phi}}^\top H_{\boldsymbol{\phi}} + n\lambda I)^{-1}H_{\boldsymbol{\phi}}^\top \boldsymbol{y}$($H_{\boldsymbol{\phi}} = [\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i)]_{i=1}^n \in \mathbb{R}^{n \times m}$)。または $\hat{\boldsymbol{w}} = H_{\boldsymbol{\phi}}^\top(H_{\boldsymbol{\phi}}H_{\boldsymbol{\phi}}^\top + n\lambda I)^{-1}\boldsymbol{y}$という双対形式($m > n$ のとき効率的)でも計算できる。

合同最適化と特徴崩壊

実際には $\boldsymbol{\phi}$ と $\boldsymbol{w}$ を同時に最適化する合同最適化(Joint Optimization)が行われる:

\[\min_{\boldsymbol{\phi}, \boldsymbol{w}}\frac{1}{n}\sum_{i=1}^n \ell(y_i, \boldsymbol{w}^\top \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_i))+ \lambda_1\|\boldsymbol{w}\|^2 + \lambda_2 R(\boldsymbol{\phi})\]

ここで $R(\boldsymbol{\phi})$ は基底パラメータへの正則化項。合同最適化における根本的な課題として特徴崩壊(Feature Collapse)がある:$\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}) \equiv \boldsymbol{0}$(定数写像)やランク欠損の表現(すべての入力が同一の特徴に写像される)が損失をゼロにする自明解として存在する。この崩壊を防ぐための設計原理として以下が重要である:

  • 次元正則化:特徴の各次元を独立に活用させるための制約$\mathrm{rank}(H_{\boldsymbol{\phi}}) = m$ または共分散行列 $H_{\boldsymbol{\phi}}^\top H_{\boldsymbol{\phi}}/n \approx I_m$。
  • 対照損失(Contrastive Loss):類似した入力の特徴を近づけ、異なる入力を遠ざけることで崩壊を防ぐ(後述)。
  • 予測ターゲット:ラベルや補助タスクによる予測損失が自明解を罰する。

転移学習における学習基底

事前学習と微調整

転移学習(Transfer Learning)は学習基底の最も重要な応用であり、大規模なソースタスク $\mathcal{D}_{\mathrm{src}}$ で学習した基底 $\boldsymbol{h}_{\hat{\boldsymbol{\phi}}}$ を小規模なターゲットタスク $\mathcal{D}_{\mathrm{tgt}}$ に転用する。

事前学習(Pretraining):ソースデータで基底パラメータを最適化する:

\[\hat{\boldsymbol{\phi}} = \arg\min_{\boldsymbol{\phi}}\frac{1}{|\mathcal{D}_{\mathrm{src}}|}\sum_{(\boldsymbol{x},y) \in \mathcal{D}_{\mathrm{src}}}\ell_{\mathrm{src}}(y, f_{\boldsymbol{\phi},\boldsymbol{w}}(\boldsymbol{x}))\]

微調整(Fine-tuning):学習済み基底 $\boldsymbol{h}_{\hat{\boldsymbol{\phi}}}$ を初期値としてターゲットデータで更新する:

\[(\hat{\boldsymbol{\phi}}', \hat{\boldsymbol{w}}')= \arg\min_{\boldsymbol{\phi}, \boldsymbol{w}}\frac{1}{|\mathcal{D}_{\mathrm{tgt}}|}\sum_{(\boldsymbol{x},y) \in \mathcal{D}_{\mathrm{tgt}}}\ell_{\mathrm{tgt}}(y, \boldsymbol{w}^\top\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}))+ \lambda_{\boldsymbol{\phi}}\|\boldsymbol{\phi} - \hat{\boldsymbol{\phi}}\|^2\]

正則化項 $\lambda_{\boldsymbol{\phi}}\|\boldsymbol{\phi} - \hat{\boldsymbol{\phi}}\|^2$ は微調整中に事前学習済み基底から過度に逸脱しないよう制約する(L2-SP;Li et al., 2018)。線形評価プロトコル(Linear Evaluation Protocol)では$\boldsymbol{\phi}$ を完全に固定し $\boldsymbol{w}$ のみを最適化することで基底の質を評価する:良い基底は固定したままでも高い性能を示す。

特徴の転移可能性の理論

基底の転移可能性を理論的に評価する指標として、ソースタスクとターゲットタスクの関係を以下のように定量化する。

H-乖離(H-divergence):ドメイン適応(Domain Adaptation)の文脈で、ソースドメイン $P_s$ とターゲットドメイン $P_t$ の乖離を

\[d_{\mathcal{H}}(P_s, P_t)= 2\sup_{h \in \mathcal{H}}\left|P_s(h(\boldsymbol{x})=1) - P_t(h(\boldsymbol{x})=1)\right|\]

と定義する。Ben-David et al.(2010)の境界はターゲットドメインでの汎化誤差を

\[\epsilon_t(\hat{h})\leq \epsilon_s(\hat{h})+ \frac{1}{2}d_{\mathcal{H}}(P_s, P_t)+ \lambda^*\]

と上界する($\epsilon_s$:ソースドメイン誤差、$\lambda^*$:理想的な共有仮説の誤差)。学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ が誘導する特徴空間で$d_{\mathcal{H}}$ が小さいとき転移が成功しやすい。

自己教師あり学習による基底の学習

ラベルなし大規模データから汎化可能な基底を学習する自己教師あり学習(Self-Supervised Learning, SSL)は、学習基底の実用的な構築法として最も成功している枠組みである。SSL は人工的なラベル(疑似ラベル、Pseudo-labels)を自動生成し、補助タスクを通じて汎化可能な特徴表現を学習する。

対照学習(Contrastive Learning)

対照学習(Contrastive Learning)は同一データの異なる拡張(正例ペア)を特徴空間で近づけ、異なるデータの拡張(負例ペア)を遠ざけることで特徴崩壊を防ぎながら有用な基底を学習する。

SimCLR(Chen et al., 2020)の損失関数は$N$ 個のデータ点それぞれに対して二種類の拡張$\tilde{\boldsymbol{x}} = t(\boldsymbol{x})$、$\tilde{\boldsymbol{x}}' = t'(\boldsymbol{x})$($t, t' \sim \mathcal{T}$)を生成し、正例ペア $(\tilde{\boldsymbol{x}}_i, \tilde{\boldsymbol{x}}_i')$ の類似度を最大化するNT-Xent 損失(Normalized Temperature-scaled Cross Entropy)として

\[\mathcal{L}_{\mathrm{SimCLR}}= -\frac{1}{N}\sum_{i=1}^N\log\frac{\exp\!\left(\mathrm{sim}(\boldsymbol{z}_i, \boldsymbol{z}_i')/\tau\right)}{\sum_{j=1}^N \mathbf{1}[j \neq i] \exp\!\left(\mathrm{sim}(\boldsymbol{z}_i, \boldsymbol{z}_j')/\tau\right)}\]

と定義される($\boldsymbol{z}_i = g(h_{\boldsymbol{\phi}}(\tilde{\boldsymbol{x}}_i))$:投影ヘッド適用後の表現、$\mathrm{sim}(\boldsymbol{u},\boldsymbol{v}) = \boldsymbol{u}^\top\boldsymbol{v}/(\|\boldsymbol{u}\|\|\boldsymbol{v}\|)$:コサイン類似度、$\tau > 0$:温度パラメータ)。分母の負例集合には同一ミニバッチ内の $2(N-1)$ 個のペアが使用される。

対照学習の目標は相互情報量の下限最大化として理解できる(Wang–Isola, 2020):

\[\mathcal{L}_{\mathrm{SimCLR}} \approx-I(\boldsymbol{z}; \boldsymbol{z}') + \text{const.}\]

ここで $\boldsymbol{z}$ と $\boldsymbol{z}'$ は同一データの異なる拡張から得られた表現である。相互情報量の最大化は「拡張に不変な情報を抽出する」という不変表現学習の目標と対応する。

崩壊防止機構

対照学習の変種は特徴崩壊の防止機構によって分類できる:

  • 負例サンプリング(SimCLR・MoCo):異なるサンプルとの反発力により崩壊を防ぐ。大きなバッチサイズ(SimCLR)またはメモリキュー(MoCo;He et al., 2020)が必要。
  • 非対称アーキテクチャ(BYOL):Bootstrap Your Own Latent(Grill et al., 2020)はオンラインネットワーク(勾配更新あり)とターゲットネットワーク(指数移動平均で更新)の非対称構造と予測ヘッドの組み合わせで負例なしに崩壊を防ぐ。ターゲットネットワークが「自己ブートストラップ」的な疑似ターゲットを提供し、$\boldsymbol{q} \leftarrow f_\theta(\boldsymbol{z})$、$\boldsymbol{z}' \leftarrow f_{\xi}(\tilde{\boldsymbol{x}}')$として $\|\boldsymbol{q}/\|\boldsymbol{q}\| - \boldsymbol{z}'/\|\boldsymbol{z}'\|\|^2$ を最小化する。
  • 冗長性削減(Barlow Twins):二つの拡張の特徴間の相関行列を単位行列に近づけることで特徴の各次元を互いに独立かつ情報量豊かに保つ:\[\mathcal{L}_{\mathrm{BT}}= \sum_j (1 - C_{jj})^2+ \lambda \sum_{j \neq k} C_{jk}^2\]($C_{jk} = \frac{\sum_i z_{A,i,j} z_{B,i,k}}{\sqrt{\sum_i z_{A,i,j}^2}\sqrt{\sum_i z_{B,i,k}^2}}$:交差相関行列)。対角成分を $1$ に近づけることで各次元が情報を持つことを促し、非対角成分をゼロに近づけることで冗長性を排除する。
  • 特徴の均一化(VICReg):分散(Variance)・不変性(Invariance)・共分散(Covariance)の三項からなる損失で崩壊・冗長性・不変性を同時に制御する:\[\mathcal{L}_{\mathrm{VICReg}}= \lambda \underbrace{\mathcal{L}_{\mathrm{inv}}}_{\text{不変性}}+ \mu \underbrace{\mathcal{L}_{\mathrm{var}}}_{\text{分散維持}}+ \nu \underbrace{\mathcal{L}_{\mathrm{cov}}}_{\text{共分散縮小}}\]

マスク自己符号化器(MAE)とCLIP

MAE(Masked Autoencoder;He et al., 2022)は入力の大部分(典型的に 75\%)をマスクし、可視パッチのみを入力として受け取るエンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}$ とマスクされたパッチを復元するデコーダ $g_{\boldsymbol{\psi}}$ の組み合わせで学習する:

\[\mathcal{L}_{\mathrm{MAE}}= \frac{1}{|\mathcal{M}|}\sum_{j \in \mathcal{M}}\|g_{\boldsymbol{\psi}}(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}_{\mathcal{V}}))_j - \boldsymbol{x}_j\|^2\]

($\mathcal{M}$:マスクされたパッチの集合、$\mathcal{V}$:可視パッチの集合)。高マスク率が非自明な再構成タスクを生み出し、局所的なテクスチャに依存しない大域的な意味的特徴を基底として学習させる。

CLIP(Contrastive Language-Image Pretraining;Radford et al., 2021)は画像エンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}^{\mathrm{img}}$ とテキストエンコーダ $\boldsymbol{h}_{\boldsymbol{\phi}}^{\mathrm{txt}}$ を画像-テキストペアの対照学習で同時に学習する:

\[\mathcal{L}_{\mathrm{CLIP}}= -\frac{1}{N}\sum_{i=1}^N\left[\log\frac{e^{\boldsymbol{z}_i^{\mathrm{img}\top}\boldsymbol{z}_i^{\mathrm{txt}}/\tau}} {\sum_j e^{\boldsymbol{z}_i^{\mathrm{img}\top}\boldsymbol{z}_j^{\mathrm{txt}}/\tau}}+\log\frac{e^{\boldsymbol{z}_i^{\mathrm{txt}\top}\boldsymbol{z}_i^{\mathrm{img}}/\tau}} {\sum_j e^{\boldsymbol{z}_i^{\mathrm{txt}\top}\boldsymbol{z}_j^{\mathrm{img}}/\tau}}\right]\]

CLIP の基底は画像とテキストの共通意味空間を定義し、ゼロショット分類(テキストプロンプトによる新クラスの識別)を可能にする。これは「基底が言語的概念と整合した多モーダル空間を構築する」という学習基底の最も洗練された実例である。

メタ学習による基底の学習

問題設定

メタ学習(Meta-Learning、Learning to Learn)は複数のタスク $\{\mathcal{T}_\tau\}_{\tau \in \mathcal{T}}$ からタスクを横断して汎化できる基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ を学習する枠組みである。各タスク $\mathcal{T}_\tau$ は小規模な訓練集合(サポートセット)$\mathcal{S}_\tau = \{(\boldsymbol{x}_i, y_i)\}_{i=1}^{K}$ と評価集合(クエリセット)$\mathcal{Q}_\tau$ から構成される$N$-way $K$-shot 問題として定式化される。

MAML による基底の学習

MAML(Model-Agnostic Meta-Learning;Finn et al., 2017)は「少ステップの勾配降下で新タスクに適応できる初期パラメータ」を求める二段階最適化として定式化される:

\[\min_{\boldsymbol{\phi}}\mathbb{E}_{\tau \sim p(\mathcal{T})}\mathcal{L}_{\mathcal{Q}_\tau}\!\left(f_{\boldsymbol{\phi} - \alpha\nabla_{\boldsymbol{\phi}}\mathcal{L}_{\mathcal{S}_\tau}(f_{\boldsymbol{\phi}})}\right)\]

内側更新 $\boldsymbol{\phi}_\tau' = \boldsymbol{\phi} - \alpha\nabla_{\boldsymbol{\phi}}\mathcal{L}_{\mathcal{S}_\tau}$は各タスクへの高速適応であり、外側更新はクエリセット上の損失を通じて高速適応を可能にする初期値 $\boldsymbol{\phi}$ を最適化する。MAML の外側更新には Hessian(二階微分)が必要であり、一階近似(FOMAML)または効率的な実装(Reptile;Nichol et al., 2018)が実用上用いられる。

学習基底の観点から MAML を解釈すると、$\boldsymbol{\phi}$ は「タスクに共通な表現空間の初期値」として機能し、各タスクの適応は $\boldsymbol{\phi}$ の近傍でのファインチューニングとして実現される。MAML が学習するのは「良い初期化点としての基底」であり、タスク特異な情報は適応ステップで追加される。

プロトタイプネットワークによる基底の評価

プロトタイプネットワーク(Prototypical Networks;Snell et al., 2017)は学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ の質をクラスプロトタイプ(クラス内特徴の平均)との距離で評価する:

\[\boldsymbol{c}_k = \frac{1}{|\mathcal{S}_k|}\sum_{(\boldsymbol{x},y) \in \mathcal{S}_k} \boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}),\qquad p(y=k \mid \boldsymbol{x}) = \frac{\exp(-d(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}), \boldsymbol{c}_k))}{\sum_j \exp(-d(\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x}), \boldsymbol{c}_j))}\]

($d$:ユークリッド距離またはコサイン距離)。プロトタイプネットワークは学習基底が「同クラスの点が特徴空間でクラスタ化される」という性質を持つよう訓練され、少数例($K$-shot)での分類において優れた性能を示す。

過剰パラメータ化体制での基底学習

暗黙の正則化と最小ノルム解

過剰パラメータ化($|\boldsymbol{\theta}| \gg n$)のニューラルネットワークにおいて、SGD による訓練は陽な正則化なしで汎化する解を発見する。この現象の理論的説明として、勾配降下法がパラメータ空間での最小ノルム解$\hat{\boldsymbol{\theta}} = \arg\min_{\boldsymbol{\theta}} \|\boldsymbol{\theta}\|$s.t. $f_{\boldsymbol{\theta}}(\boldsymbol{x}_i) = y_i$($\forall i$)に近い解を選択するという暗黙の正則化(Implicit Regularization)仮説がある。

線形ネットワーク($f_{\boldsymbol{\theta}}(\boldsymbol{x}) = W_L\cdots W_1\boldsymbol{x}$)に対して、深さ $L$ の行列積の最小ノルム補間解は正規化行列積のバランス条件$W_\ell^\top W_\ell = W_{\ell+1}W_{\ell+1}^\top$($\forall \ell$)を満たす解に収束することが理論的に示されており(Arora et al., 2019)、この解は行列の核ノルム(Nuclear Norm)最小化問題の解に漸近的に一致する。核ノルム最小化は低ランク行列近似の凸緩和であるため、深い線形ネットワークは「暗黙の低ランク正則化」を行っていると解釈できる。

ニューラルスケーリング則

ニューラルスケーリング則(Neural Scaling Laws;Kaplan et al., 2020)は過剰パラメータ化体制での基底学習の定量的な法則として、モデルサイズ $N$・データ数 $D$・計算量 $C$ とテスト損失 $\mathcal{L}$ の間の冪乗則

\[\mathcal{L}(N) \propto N^{-\alpha_N},\quad\mathcal{L}(D) \propto D^{-\alpha_D},\quad\mathcal{L}(C) \propto C^{-\alpha_C}\]

を示す(典型的に $\alpha_N \approx 0.07$、$\alpha_D \approx 0.10$、$\alpha_C \approx 0.05$for 言語モデル)。スケーリング則は「より大きなモデルはより良い基底を学習する」という経験的法則を定量化し、過剰パラメータ化体制での基底品質の向上を予測する。Chinchilla スケーリング則(Hoffmann et al., 2022)では最適なモデルサイズとデータ数の比が $N \propto D$ であることが示されており、「基底学習の効率」の観点から事前学習の設計指針を与える。

連続学習(破滅的忘却と基底の安定性)

連続学習(Continual Learning)ではタスク $\mathcal{T}_1 \to \mathcal{T}_2 \to \cdots$ を順次学習する際に、新タスクの学習が旧タスクの基底を上書きする破滅的忘却(Catastrophic Forgetting;McCloskey–Cohen, 1989)が生じる。学習基底の観点からは、新タスク用に $\boldsymbol{\phi}$ を更新すると旧タスクに有用だった基底関数が失われる問題である。

対策として以下のアプローチが提案されている:

  • 弾性重み固定(EWC;Kirkpatrick et al., 2017):Fisher 情報行列 $F = \mathbb{E}[(\nabla_{\boldsymbol{\phi}}\log p(y\mid\boldsymbol{x},\boldsymbol{\phi}))^2]$を用いて旧タスクに重要な基底パラメータを保護する正則化:\[\mathcal{L}_{\mathcal{T}_2}(\boldsymbol{\phi})+ \sum_j \frac{\lambda}{2} F_j (\phi_j - \hat{\phi}_{j,\mathcal{T}_1})^2\]Fisher 情報の大きい(旧タスクに重要な)方向への更新を制限し、旧タスクの基底を保護する。
  • 漸進的ニューラルネットワーク(PNN):新タスクごとに新しい列(Column)を追加し、旧タスクの基底を完全に固定してラテラル接続でのみ利用する。忘却は完全に防げるが容量が線形増大する。
  • プロジェクション法(GradOrth 等):新タスクの勾配更新を旧タスクの基底が張る部分空間の直交補空間に投影し、旧タスクの基底への干渉を排除する。

学習基底の解釈可能性と構造

特徴の解釈可能性

学習された基底関数 $\phi_j^{\boldsymbol{\phi}}(\boldsymbol{x}) = [\boldsymbol{h}_{\boldsymbol{\phi}}(\boldsymbol{x})]_j$の解釈可能性は実用的に重要な問題である。以下の技法が基底の解釈に用いられる:

  • 活性化最大化(Activation Maximization):$j$ 番目の基底関数を最大化する入力$\boldsymbol{x}^* = \arg\max_{\boldsymbol{x}} \phi_j^{\boldsymbol{\phi}}(\boldsymbol{x})$を最適化して「この基底が何を検出するか」を可視化する。
  • SHAP・LIME:基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ を通じた予測 $f_{\boldsymbol{\theta}}(\boldsymbol{x})$ に対して各入力次元の寄与を Shapley 値または局所線形近似で推定する。
  • プローブ分類器(Probing Classifier):学習基底 $\boldsymbol{h}_{\boldsymbol{\phi}}$ の上に単純な線形分類器を学習し、特定の言語的・視覚的概念が基底に符号化されているかを評価する。

基底の幾何学的構造

訓練後の特徴空間における幾何学的構造を分析することで学習基底の品質を評価できる。

  • 均一性(Uniformity)と整合性(Alignment):Wang–Isola(2020)は学習基底の品質を整合性(正例ペアの特徴が近い)$\mathcal{L}_{\mathrm{align}} = \mathbb{E}_{(\boldsymbol{x},\boldsymbol{x}') \sim p_{\mathrm{pos}}}\|\boldsymbol{z}-\boldsymbol{z}'\|^2$と均一性(特徴が単位球面上に均一に分布)$\mathcal{L}_{\mathrm{uniform}} = \log\mathbb{E}_{(\boldsymbol{z},\boldsymbol{z}') \sim p_{\mathrm{data}}^2}e^{-2\|\boldsymbol{z}-\boldsymbol{z}'\|^2}$の二指標で評価することを提案した。
  • 固有次元(Intrinsic Dimensionality):学習基底が誘導する特徴多様体の有効次元を測定する。高品質な基底は入力次元 $d$ より大幅に低い固有次元を持つことが多い。
  • 中心核整合(CKA;Centered Kernel Alignment):二つのネットワーク(または層)の学習基底の類似度をカーネル行列の整合性で比較する:\[\mathrm{CKA}(K_X, K_Y)= \frac{\|K_Y^\top K_X\|_F} {\|K_X\|_F\|K_Y\|_F}\]異なるアーキテクチャ・初期化・学習率で訓練されたネットワークが類似した基底を学習するかを評価し、「学習基底の普遍性」の研究に用いられる。

理論的枠組みの統合

学習基底としてのニューラルネットワークを統一的に理解する理論的枠組みを整理する。

理論的枠組み学習基底への含意主要な結果
NTK 理論無限幅では基底が固定(特徴学習なし)。有限幅での特徴学習が適応的基底の本質。$\Theta(\boldsymbol{x},\boldsymbol{x}') = \langle\nabla_{\boldsymbol{\theta}}f,\nabla_{\boldsymbol{\theta}}f'\rangle$が訓練中定数化。
Mean Field 理論深さ・幅・活性化関数が基底の統計的性質(平均・分散の伝播)を規定。Edge of Chaos(混沌の縁)での初期化が信号伝播の最適化と相関。
情報ボトルネック基底が $I(\boldsymbol{h};Y)$ を最大化しつつ$I(\boldsymbol{h};\boldsymbol{X})$ を最小化する圧縮を達成。訓練後期に圧縮フェーズが生じるという仮説(実験的検証は議論中)。
スケーリング則モデルサイズ・データ・計算の冪乗則により基底の品質向上を予測・設計できる。$\mathcal{L} \propto N^{-\alpha}$。Chinchilla 則による最適スケーリング。
相互情報量最大化対照学習は入力の異なるビュー間の相互情報量下限を最大化。$\mathcal{L}_{\mathrm{InfoNCE}} \geq -\log N + I(\boldsymbol{z};\boldsymbol{z}')$。
ドメイン適応理論転移可能な基底は H-乖離を最小化する特徴空間を構築する。$\epsilon_t \leq \epsilon_s + d_{\mathcal{H}}/2 + \lambda^*$。

まとめ

学習基底としてのニューラルネットワークは、固定された係数の最適化(固定基底モデル)を超えて基底関数そのものをデータから最適化することで合成関数構造の利用・次元の呪いの部分的回避・タスク横断的汎化を実現する。特徴抽出器 $\boldsymbol{h}_{\boldsymbol{\phi}}$ と読み出しパラメータ $\boldsymbol{w}$ の分離は基底学習と係数学習の二段階最適化として定式化され、線形評価プロトコルがその品質評価の標準的手段となる。自己教師あり学習(SimCLR・BYOL・Barlow Twins・MAE・CLIP)はラベルなしデータから汎化可能な基底を学習する実用的枠組みを提供し、崩壊防止機構の設計が理論的・実践的に重要な課題となる。メタ学習(MAML・プロトタイプネットワーク)はタスク横断的な基底学習を通じて少数例適応を実現し、連続学習では EWC・漸進的ネットワーク・プロジェクション法が破滅的忘却への対策として基底の安定性を保護する。NTK 理論は無限幅での固定基底への等価性を示し、有限幅での特徴学習が適応的基底の本質であることを浮き彫りにする。スケーリング則は過剰パラメータ化体制での基底品質の冪乗的向上を定量化し、大規模事前学習モデルの設計指針を与える。均一性・整合性・CKA などの幾何学的評価指標は学習基底の品質を特徴空間の構造から定量化し、転移可能性・解釈可能性の理論的理解を深める。これらを統合した「学習基底としての NN」の視点は統計的学習理論・関数解析・情報理論・最適化理論を横断する現代深層学習の統一的理解の核心をなす。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習