特徴空間の動的構成(Dynamic Construction of Feature Spaces)は、固定された特徴写像ではなく入力・タスク・文脈に応じて特徴空間そのものを適応的に変形・拡張・選択する枠組みである。静的な RKHS やスプラインが事前に固定された関数クラスを仮定するのに対し、動的特徴空間は学習過程・推論過程・データの流れとともに特徴空間の幾何学的構造が変化するという本質的に動的な性質を持つ。自己注意機構・グラフニューラルネットワーク・ハイパーネットワーク・ニューラルプロセス・動的グラフ理論を統合した現代深層学習の中核概念である。
入力空間 $\mathcal{X}$、特徴空間 $\mathcal{Z}$、コンテキスト空間 $\mathcal{C}$(文脈・タスク・補助情報)を考える。静的特徴写像は $\phi: \mathcal{X} \to \mathcal{Z}$($\mathcal{C}$ に依存しない)であり、動的特徴写像は
\[\phi_c: \mathcal{X} \to \mathcal{Z}_c,\quad c \in \mathcal{C}\]というコンテキスト依存の写像の族として定義される。動的構成では特徴空間 $\mathcal{Z}_c$ 自体がコンテキスト $c$ に依存して変化し、同一の入力 $\boldsymbol{x}$ でも文脈が変われば異なる特徴表現が生成される。本節では以下の三レベルの動的性を区別する:
固定基底(カーネル・スプライン・固定重みネットワーク)における静的特徴空間の限界を形式化する。固定カーネル $k: \mathcal{X} \times \mathcal{X} \to \mathbb{R}$ のMercer 展開 $k(\boldsymbol{x},\boldsymbol{x}') = \sum_j \lambda_j \varphi_j(\boldsymbol{x})\varphi_j(\boldsymbol{x}')$ において、固有関数 $\{\varphi_j\}$ は入力空間 $\mathcal{X}$ 上の測度 $\nu$ に対して大域的に固定されており、以下の限界が生じる:
自己注意機構(Self-Attention;Vaswani et al., 2017)は入力系列 $\{\boldsymbol{x}_i\}_{i=1}^n$ の各要素が他のすべての要素との関係を動的に計算し、文脈依存の特徴表現を構築する。入力行列 $X \in \mathbb{R}^{n \times d}$(各行が $\boldsymbol{x}_i^\top$)に対して、クエリ・キー・バリュー行列を
\[Q = XW_Q,\quad K = XW_K,\quad V = XW_V\]($W_Q, W_K \in \mathbb{R}^{d \times d_k}$、$W_V \in \mathbb{R}^{d \times d_v}$)と定義し、スケールドドット積注意(Scaled Dot-Product Attention)を
\[\mathrm{Attention}(Q, K, V)= \mathrm{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V\in \mathbb{R}^{n \times d_v}\]と定義する。スケール因子 $1/\sqrt{d_k}$ は内積の分散を正規化し勾配消失を防ぐ($d_k$ が大きいと内積が大きくなりソフトマックスが飽和する)。
位置 $i$ の出力表現は
\[\boldsymbol{z}_i= \sum_{j=1}^n A_{ij} \boldsymbol{v}_j,\quad A_{ij} = \frac{\exp(\boldsymbol{q}_i^\top \boldsymbol{k}_j/\sqrt{d_k})}{\sum_{l=1}^n \exp(\boldsymbol{q}_i^\top \boldsymbol{k}_l/\sqrt{d_k})}\]という文脈依存の重み付き平均であり、注意重み $A_{ij}$ が入力に応じて動的に決定される。注意行列 $A \in [0,1]^{n \times n}$($A \mathbf{1} = \mathbf{1}$)は「どのトークンが互いに関連するか」を符号化した動的グラフ(Dynamic Graph)として解釈できる。
注意機構を関数空間の観点から解釈すると、自己注意は動的な正定値カーネルを定義する:
\[k_{\mathrm{attn}}(\boldsymbol{x}_i, \boldsymbol{x}_j; \{x_l\}_{l=1}^n)= A_{ij}= \frac{\exp((W_Q \boldsymbol{x}_i)^\top (W_K \boldsymbol{x}_j)/\sqrt{d_k})} {\sum_l \exp((W_Q \boldsymbol{x}_i)^\top (W_K \boldsymbol{x}_l)/\sqrt{d_k})}\]このカーネルは入力系列全体 $\{x_l\}$ に依存するため、固定カーネル $k(\boldsymbol{x}_i, \boldsymbol{x}_j)$ とは本質的に異なる文脈依存カーネル(Context-Dependent Kernel)である。系列の内容が変わればカーネルの値も変化し、特徴空間の幾何学的構造が動的に変形される。
線形注意(Linear Attention)では$\exp(\boldsymbol{q}^\top \boldsymbol{k}/\sqrt{d_k}) \approx \phi(\boldsymbol{q})^\top\phi(\boldsymbol{k})$という特徴写像による近似を行い、計算量を $O(n^2 d)$ から $O(n d^2)$ に削減できる。これは動的カーネルを固定の低ランク特徴写像で近似するものと解釈できる。
多頭注意(Multi-Head Attention, MHA)は $H$ 個の注意ヘッドを並列に適用し、異なる関係構造を並列にキャプチャする:
\[\mathrm{MHA}(X)= [{\rm head}_1, \ldots, {\rm head}_H] W_O,\quad {\rm head}_h = \mathrm{Attention}(XW_Q^h, XW_K^h, XW_V^h)\]各ヘッド $h$ は独立した動的カーネル $k_{\mathrm{attn}}^h$ を定義し、$H$ 個の異なる動的特徴空間 $\{\mathcal{Z}_h\}_{h=1}^H$ が同時並列に構築される。$W_O \in \mathbb{R}^{Hd_v \times d}$ による線形結合で統合されるため、多頭注意は $H$ 個の動的特徴空間の学習された線形結合として理解できる。ヘッドごとに異なる関係(構文・意味・位置等)を捉えることが実験的に確認されており、複数の特徴空間の動的な並列構成が表現力の源泉となる。
自己注意を有向グラフ $\mathcal{G}_t = (\mathcal{V}, \mathcal{E}_t, \{w_{ij}^t\})$($\mathcal{V} = \{1,\ldots,n\}$、$w_{ij}^t = A_{ij}$)として解釈すると、注意重み行列 $A^{(t)}$ はネットワークの $t$ 層目での動的エッジ重みを定義する。完全グラフ(全トークン間の接続)を仮定する標準の自己注意に対して、スパース注意(Sparse Attention)・局所注意(Local Attention)・線形注意はグラフの疎性を制御する変種として統一的に理解できる。動的グラフの観点からは、各層で異なる $A^{(\ell)}$ が生成されるため、$L$ 層 Transformer は $L$ 個の異なる動的グラフを通じた逐次的な特徴変換として記述される。
クロスアテンション(Cross-Attention)ではクエリが一方の系列 $X$、キー・バリューが別の系列(文脈) $C$ から生成され、文脈に条件付けられた特徴空間を動的に構築する:
\[Q = XW_Q,\quad K = CW_K,\quad V = CW_V,\quad \boldsymbol{z}_i = \sum_j A_{ij}\boldsymbol{v}_j\]ここで文脈 $C$ はプロンプト(言語指示)・参照画像・外部メモリ・数例の訓練例(Few-Shot 文脈)等を表す。$C$ が変化するたびに注意重み $A_{ij}$ が変化し、異なる特徴空間が動的に構築される。拡散モデル(Diffusion Model)でのクラス・テキスト条件付けはクロスアテンションを通じた動的特徴空間の条件付けとして実装される。
大規模言語モデルにおける文脈内学習(In-Context Learning, ICL;Brown et al., 2020)は推論時に $K$ 個の例示$\{(\boldsymbol{x}_j, y_j)\}_{j=1}^K$ をプロンプトとして入力し、重みを更新せずに新たな入力 $\boldsymbol{x}_{\mathrm{new}}$ に対する予測を行う。これは Level 3 の動的特徴空間の典型例であり、観測された例示が Transformer の自己注意を通じて推論時の特徴空間を動的に再構成する。
ICL の理論的解釈として、Transformer が実装する関数が勾配降下法による少数ショット学習の近似となっていることが示されている(Von Oswald et al., 2023)。具体的には線形注意 Transformer の ICL は勾配降下法による線形回帰の実装と等価であり、自己注意が「推論時の動的特徴空間上での最適化」を実現している:
\[\hat{y}_{\mathrm{new}}\approx \boldsymbol{x}_{\mathrm{new}}^\top W_{\mathrm{GD}},\quad W_{\mathrm{GD}} = \eta \sum_{j=1}^K y_j \boldsymbol{x}_j^\top\]この解釈はICL を「固定重みモデルによる動的特徴空間上の暗黙的な学習」として位置づけ、メタ学習との深い接続を示す。
ハイパーネットワーク(HyperNetwork;Ha et al., 2017)はコンテキスト $\boldsymbol{c} \in \mathcal{C}$ を入力として受け取り、主ネットワークの重みを動的に生成するネットワークである:
\[\boldsymbol{\theta}(\boldsymbol{c}) = H_{\boldsymbol{\psi}}(\boldsymbol{c}),\quad f(\boldsymbol{x}; \boldsymbol{\theta}(\boldsymbol{c})) = f({\boldsymbol{x}}; H_{\boldsymbol{\psi}}(\boldsymbol{c}))\]ハイパーネットワーク $H_{\boldsymbol{\psi}}$ のパラメータ $\boldsymbol{\psi}$ は学習済みのまま固定され、コンテキスト $\boldsymbol{c}$ が変化するたびに主ネットワークの重み$\boldsymbol{\theta}(\boldsymbol{c})$ が動的に生成される。これにより主ネットワークの特徴空間 $\mathcal{Z}_{\boldsymbol{c}}$ がコンテキストに完全に依存する動的な構造を持つ。
コンテキストの例として以下が考えられる:
LoRA(Low-Rank Adaptation;Hu et al., 2022)は事前学習済みモデルの重み $W_0 \in \mathbb{R}^{d \times k}$ に対して、低ランク摂動を付加する効率的な特徴空間適応手法である:
\[W = W_0 + \Delta W = W_0 + BA,\quad B \in \mathbb{R}^{d \times r},\; A \in \mathbb{R}^{r \times k},\; r \ll \min(d,k)\]事前学習済み重み $W_0$ は固定し、低ランク行列 $B$・$A$(パラメータ数 $r(d+k)$)のみを学習する。ランク $r$ の制約は「特徴空間の変化が低ランク部分空間に制限される」という帰納バイアスを与え、過学習を防ぎつつ効率的な特徴空間の適応を実現する。スケーリング係数 $\alpha/r$ を乗じた形$\Delta W = ({\alpha}/{r})BA$ で初期化時の更新量を制御する。
LoRA の動的特徴空間としての解釈:固定された $W_0$ が定義する基底特徴空間に対して、低ランク摂動 $BA$ がタスク特異な低次元部分空間を追加的に構築する。全パラメータ数の $1\%$ 以下の追加パラメータでフルファインチューニングに匹敵する性能が多くのベンチマークで達成される。
プレフィックスチューニング(Prefix Tuning;Li–Liang, 2021)は各層の注意機構のキー・バリュー系列の先頭に学習可能なベクトル列(プレフィックス)$P_K, P_V \in \mathbb{R}^{l \times d}$ を付加する:
\[\boldsymbol{z}_i = \sum_{j=0}^{l+n} A_{ij} v_j,\quad \{v_j\}_{j=1}^l = P_V,\; \{v_j\}_{j=l+1}^{l+n} \text{は入力から}\]プレフィックスは「仮想的な文脈」として機能し、各層の注意重み $A_{ij}$ を通じて特徴空間を動的に変調する。モデル全体の重みを固定し、プレフィックス $P_K, P_V$(全パラメータの $0.1\%$ 以下)のみをタスクごとに学習することで高効率な特徴空間の適応を実現する。
グラフニューラルネットワーク(GNN)はグラフ構造 $\mathcal{G} = (\mathcal{V}, \mathcal{E})$ 上でノード特徴を近傍集約により動的に更新する:
\[\boldsymbol{h}_v^{(\ell+1)}= \mathrm{UPDATE}^{(\ell)}\!\left(\boldsymbol{h}_v^{(\ell)},\;\mathrm{AGG}^{(\ell)}\!\left(\{(\boldsymbol{h}_v^{(\ell)}, \boldsymbol{h}_u^{(\ell)}, \boldsymbol{e}_{vu}) : u \in \mathcal{N}(v)\}\right)\right)\]グラフ構造 $\mathcal{G}$ が変化する動的グラフ(Dynamic Graph)ではノードの追加・削除・エッジの変化に伴い、集約される近傍集合 $\mathcal{N}(v)$ が変化し特徴空間が動的に再構成される。分子グラフ・ソーシャルネットワーク・知識グラフはその典型的な動的グラフ構造を持つ。
グラフ注意ネットワーク(GAT;Veličković et al., 2018)では注意重み $\alpha_{vu}$ が動的に計算される:
\[\alpha_{vu}= \frac{\exp\!\left(\mathrm{LeakyReLU}\!\left(\boldsymbol{a}^\top [W\boldsymbol{h}_v \| W\boldsymbol{h}_u]\right)\right)} {\sum_{w \in \mathcal{N}(v)}\exp\!\left(\mathrm{LeakyReLU}\!\left(\boldsymbol{a}^\top [W\boldsymbol{h}_v \| W\boldsymbol{h}_w]\right)\right)}\]($\boldsymbol{a} \in \mathbb{R}^{2d'}$:注意ベクトル、$\|$:連結、$W \in \mathbb{R}^{d' \times d}$:重み行列)。自己注意との対比:GAT は局所的な近傍 $\mathcal{N}(v)$(スパースグラフ)での動的注意計算であり、Transformer は完全グラフ上の自己注意として統一的に解釈できる。
GNN の $L$ 層メッセージパッシングは$L$ ホップ近傍の構造情報を段階的に集約し、半径 $L$ の局所部分グラフが定義する動的な特徴空間を構築する。これは「グラフ構造に依存した動的 RKHS」として解釈でき、グラフカーネル $k_G(v,u) = \boldsymbol{h}_v^{(L)\top}\boldsymbol{h}_u^{(L)}$ がグラフ構造に適応して動的に決定される。Weisfeiler–Leman(WL)グラフ同型テストとの接続において、標準 GNN の表現能力は 1-WL テストに相当する(Xu et al., 2019)ことが示されており、より高い表現能力を持つ動的特徴空間の構成が高次 WL・幾何学的 GNN として研究されている。
ニューラルプロセス(Neural Process, NP;Garnelo et al., 2018)は文脈集合 $\mathcal{C} = \{(\boldsymbol{x}_i, y_i)\}_{i=1}^C$(観測データ)からターゲット点 $\boldsymbol{x}_*$ の予測分布を生成する枠組みであり、Level 3 の動的特徴空間の厳密な確率論的定式化である。
潜在変数 $\boldsymbol{z} \in \mathbb{R}^r$ を用いた確率モデルとして:
\[p_{\boldsymbol{\theta}}(y_* \mid \boldsymbol{x}_*, \mathcal{C})= \int p_{\boldsymbol{\theta}}(y_* \mid \boldsymbol{x}_*, \boldsymbol{z})\,p_{\boldsymbol{\phi}}(\boldsymbol{z} \mid \mathcal{C})\, d\boldsymbol{z}\]文脈エンコーダ $q_{\boldsymbol{\phi}}(\boldsymbol{z} \mid \mathcal{C})$ が観測データから潜在変数を推論し、デコーダ $p_{\boldsymbol{\theta}}(y_* \mid \boldsymbol{x}_*, \boldsymbol{z})$ が潜在変数と入力から予測を生成する。変分下限(ELBO)による学習:
\[\mathcal{L}_{\mathrm{NP}}= \mathbb{E}_{q_{\boldsymbol{\phi}}(\boldsymbol{z}\mid\mathcal{T})}\left[\sum_{(\boldsymbol{x}_*,y_*)\in\mathcal{T}}\log p_{\boldsymbol{\theta}}(y_* \mid \boldsymbol{x}_*, \boldsymbol{z})\right]- \mathrm{KL}\!\left(q_{\boldsymbol{\phi}}(\boldsymbol{z}\mid\mathcal{T}) \| q_{\boldsymbol{\phi}}(\boldsymbol{z}\mid\mathcal{C})\right)\]($\mathcal{T}$:ターゲット集合)。動的特徴空間の観点では、潜在変数 $\boldsymbol{z}$ が「文脈データが定義する特徴空間」を符号化し、新たな文脈集合 $\mathcal{C}$ が入力されるたびに特徴空間が動的に更新される。ガウス過程(GP)はニューラルプロセスの特殊ケースとして解釈でき、GP の共分散関数がニューラルプロセスの潜在変数構造に対応する。
Attentive Neural Process(ANP;Kim et al., 2019)は文脈集合を自己注意で処理することで文脈データ内の局所的な依存関係を捉える:
\[\boldsymbol{r}_i = h_{\boldsymbol{\phi}}(\boldsymbol{x}_i, y_i),\quad\boldsymbol{r}^* = \mathrm{CrossAttn}(\boldsymbol{x}_*, \{\boldsymbol{x}_i\}, \{\boldsymbol{r}_i\})\]ターゲット入力 $\boldsymbol{x}_*$ をクエリ、文脈入力 $\{\boldsymbol{x}_i\}$ をキー、文脈表現 $\{\boldsymbol{r}_i\}$ をバリューとしたクロスアテンションにより、$\boldsymbol{x}_*$ に関連する文脈を選択的に参照する。この構造は「文脈データが構築する動的 RKHS 上での予測」として解釈でき、文脈依存の注意重みがカーネル行列の役割を果たす:$k_{\mathrm{dyn}}(\boldsymbol{x}_*, \boldsymbol{x}_i) \propto \exp(\boldsymbol{q}_*^\top \boldsymbol{k}_i/\sqrt{d_k})$。
ニューラル ODE(Neural Ordinary Differential Equation;Chen et al., 2018)は残差ネットワーク$\boldsymbol{h}^{(\ell+1)} = \boldsymbol{h}^{(\ell)} + f_{\boldsymbol{\theta}}(\boldsymbol{h}^{(\ell)}, \ell)$の深さ連続極限として特徴空間の変形を常微分方程式で記述する:
\[\frac{d\boldsymbol{h}(t)}{dt} = f_{\boldsymbol{\theta}}(\boldsymbol{h}(t), t),\quad \boldsymbol{h}(0) = \boldsymbol{x},\quad \boldsymbol{z} = \boldsymbol{h}(T)\]特徴空間の変換は「連続的な体積保存(または非保存)変形」として記述され、離散的な層の積み重ねが連続的なベクトル場の積分に置き換えられる。ODE ソルバー(Runge–Kutta 等)による前向き計算と伴随法(Adjoint Method)による効率的な逆伝播が実現される:
\[\frac{d\boldsymbol{a}(t)}{dt}= -\boldsymbol{a}(t)^\top \frac{\partial f_{\boldsymbol{\theta}}(\boldsymbol{h}(t),t)}{\partial \boldsymbol{h}},\quad \boldsymbol{a}(t) = \frac{\partial \mathcal{L}}{\partial \boldsymbol{h}(t)}\]伴随変数 $\boldsymbol{a}(t)$(誤差信号の連続類似物)を逆方向に積分することで、中間状態を保存せずに勾配を計算できるためメモリ効率が $O(1)$(深さに依存しない)となる。動的特徴空間の観点では、ニューラル ODE は「特徴空間の変形を制御する連続的なベクトル場」を学習し、時刻 $t \in [0,T]$ にわたる連続的な特徴変換を定義する。
正規化流(Normalizing Flow)は可逆変換$\boldsymbol{z} = f_{\boldsymbol{\theta}}(\boldsymbol{x})$($f_{\boldsymbol{\theta}}$ は可逆)を通じて複雑な分布を単純な分布(標準正規分布等)に変換する:
\[\log p_{\boldsymbol{\theta}}(\boldsymbol{x})= \log p_{\boldsymbol{z}}(f_{\boldsymbol{\theta}}(\boldsymbol{x}))+ \log\left|\det\frac{\partial f_{\boldsymbol{\theta}}}{\partial \boldsymbol{x}}\right|\]変換の可逆性により特徴空間と入力空間が双方向に対応し、ヤコビアン行列式 $|\det \partial f/\partial \boldsymbol{x}|$ が体積変化を制御する。連続正規化流(CNF)はニューラル ODE の枠組みで$d\log p(\boldsymbol{h}(t))/dt = -\mathrm{tr}(\partial f/\partial \boldsymbol{h})$という連続変化式をたどり、任意複雑な分布を連続的な特徴空間の変形で表現する。
動的特徴空間を持つモデルクラス$\mathcal{F}_{\mathcal{C}} = \{f_c : c \in \mathcal{C}\}$の Rademacher 複雑度は文脈集合 $\mathcal{C}$ に依存する:
\[\mathfrak{R}_n(\mathcal{F}_{\mathcal{C}})= \mathbb{E}_{\boldsymbol{\sigma}, \mathcal{C}}\!\left[\sup_{f_c \in \mathcal{F}_{\mathcal{C}}}\frac{1}{n}\sum_{i=1}^n \sigma_i f_c(\boldsymbol{x}_i)\right]\]動的特徴空間のモデルは $|\mathcal{C}|$ が大きいほど$\sup_{c \in \mathcal{C}}$ が多くの関数を探索するため静的モデルより Rademacher 複雑度が大きくなる傾向があり、汎化誤差上界も大きくなりうる。しかし実際の文脈 $c$ が訓練データと強く相関する場合、有効な複雑度は理論的上界より大幅に小さくなる。この理論と実践のギャップが動的特徴空間モデルの汎化の理論的解明における主要な未解決問題である。
PAC-Bayes 枠組みでは、文脈 $c$ に依存した事後分布$Q_c$ に対して以下の汎化境界が成立する:
\[\mathbb{E}_{f \sim Q_c}[R(f)]\leq \mathbb{E}_{f \sim Q_c}[R_n(f)]+ \sqrt{\frac{\mathrm{KL}(Q_c \| P_c) + \log(n/\delta)}{2n}}\]ここで $P_c$ は文脈依存の事前分布(例:文脈で条件付けられた GP 事前分布)である。動的特徴空間では文脈 $c$ が $P_c$ と $Q_c$ の両方を通じて汎化境界に影響し、「良い文脈依存事前分布の学習」がPAC-Bayes 境界の締約に本質的に重要となる。ニューラルプロセスはこの枠組みの具体的実装として解釈できる:エンコーダが $Q_c$(事後分布)を、デコーダが $P$(尤度)を定義する。
ニューラルネットワークが定義する特徴空間は一般にユークリッド空間ではなくリーマン多様体(Riemannian Manifold)の構造を持つ。フィッシャー情報計量
\[G_{ij}(\boldsymbol{\phi})= \mathbb{E}_{\boldsymbol{x}}\!\left[\frac{\partial \log p_{\boldsymbol{\phi}}(\boldsymbol{x})}{\partial \phi_i}\frac{\partial \log p_{\boldsymbol{\phi}}(\boldsymbol{x})}{\partial \phi_j}\right]\]は学習基底 $\boldsymbol{\phi}$ が定義する特徴空間の「局所計量」を与え、パラメータ空間での自然勾配法(Natural Gradient Descent)はこの計量に沿った最適化として解釈できる。自然勾配更新 $\boldsymbol{\phi} \leftarrow \boldsymbol{\phi} - \eta G^{-1}\nabla_{\boldsymbol{\phi}}\mathcal{L}$ は特徴空間のリーマン幾何を考慮した動的な正則化として機能する。
双曲空間(Hyperbolic Space)を特徴空間として用いる双曲ニューラルネットワーク(Poincaré Embeddings;Nickel–Kiela, 2017)は階層的構造(木構造・DAG)を持つデータの特徴空間としてユークリッド空間より指数的に効率的な表現を提供する。双曲空間の曲率 $-\kappa$($\kappa > 0$)が学習可能なパラメータとなり、データの階層性に適応した動的特徴空間の幾何学的構造が形成される。
特徴空間の動的構成は、入力・タスク・文脈・データによって特徴写像 $\phi_c: \mathcal{X} \to \mathcal{Z}_c$ の依存先 $c$ が変化するという本質的に動的な性質を持ち、静的固定基底の根本的な限界を超える枠組みである。Level 1(入力適応:自己注意・動的グラフ)では文脈依存カーネル $k_{\mathrm{attn}}(\boldsymbol{x}_i,\boldsymbol{x}_j;\{x_l\})$ が入力系列全体によって動的に決定され、多頭注意が $H$ 個の並列動的特徴空間を構築する。Level 2(タスク適応:ハイパーネットワーク・LoRA・プレフィックスチューニング)ではコンテキスト $\boldsymbol{c}$ によって重み $\boldsymbol{\theta}(\boldsymbol{c})$ が動的生成され、タスク固有の特徴空間への高効率な適応が実現される。Level 3(データ適応:ニューラルプロセス・ICL)では推論時の観測データが特徴空間を動的に再構成し、GPの確率論的柔軟性とニューラルネットワークの表現能力が統合される。ニューラル ODE・正規化流は特徴空間の変形を連続体力学として記述し、GNN は局所グラフ構造に適応した動的集約により特徴空間を構築する。理論的には文脈依存 Rademacher 複雑度・PAC-Bayes 解析・フィッシャー情報計量・双曲幾何学が動的特徴空間の汎化・最適化・幾何学的構造を記述する枠組みを提供する。これら全体を通じた本質的な命題は「特徴空間はデータとタスクから学習される動的な構成物であり、固定された先験的な構造に縛られるべきでない」という現代深層学習の根本的な設計哲学である。
Mathematics is the language with which God has written the universe.