深層表現の理論における「関数合成としての深層構造」とは、多層ニューラルネットワークを単なる計算モデルとしてではなく、関数の逐次的合成として捉えることにより、その表現能力・一般化性能・幾何学的性質を厳密に理解しようとする枠組みである。この観点では、深層ネットワークは単一の複雑な関数ではなく、比較的単純な写像の合成
\[f = f_L \circ f_{L-1} \circ \cdots \circ f_1\]
として構成される階層的構造を持つ関数族であると理解される。
入力空間 $\mathcal{X} \subset \mathbb{R}^{d_0}$ から出力空間 $\mathcal{Y}$ への写像として、深層ネットワークは各層の写像
\[f_l : \mathbb{R}^{d_{l-1}} \to \mathbb{R}^{d_l}\]
の合成として定義される。典型的には
\[f_l(x) = \sigma_l(W_l x + b_l)\]
であり、全体として
\[f(x) = f_L \circ \cdots \circ f_1 (x)\]
となる。この構造は「階層的特徴抽出」として解釈される。
深層ネットワークは、関数空間における特定の部分集合
\[\mathcal{F}_{\mathrm{deep}} = \{f_L \circ \cdots \circ f_1 \mid f_l \in \mathcal{G}_l\}\]
を定義する。このクラスは浅いモデル(例えば単層ネットワーク)とは異なる幾何学的・近似論的性質を持つ。
普遍近似定理により浅いネットワークでも任意の連続関数を近似可能であるが、深層構造はより効率的な表現を可能にする。すなわち、ある関数 $f$ に対し:
となる場合が存在する。これは関数の「合成構造」を利用しているためである。
多くの実世界の関数は組成的(compositional)構造を持つ:
\[f(x_1,\dots,x_d)= g\bigl(h_1(x_{I_1}), \dots, h_k(x_{I_k})\bigr)\]
ここで各 $h_i$ は低次元関数である。このような構造に対して深層ネットワークは自然に適合する。
ReLUネットワークは入力空間を多数の線形領域に分割し、それぞれで線形関数として振る舞う。この領域数は深さに対して指数的に増加しうるため、深層構造は複雑な非線形関数を効率的に表現できる。
合成関数の微分は連鎖律により
\[Df(x) = Df_L \cdot Df_{L-1} \cdots Df_1\]
と表される。この積構造は勾配消失・爆発の原因であり、同時に特徴変換の幾何学的性質(ヤコビアンのスペクトル)を支配する。
各層は関数空間上の作用素とみなせる。特に線形変換 $W_l$ は有界線形作用素、活性化関数は非線形作用素である。深層ネットワークはこれらの作用素の合成として理解される。
深層構造は情報の圧縮と再表現の過程としても理解される。中間層は入力の冗長性を削減し、タスクに関連する情報を強調する。情報ボトルネック原理により、
\[I(X;H_l) \downarrow, \quad I(H_l;Y) \uparrow\]
という傾向が議論される。
幅が無限大に近づく極限では、ネットワークはニューラルタンジェントカーネル(NTK)により記述される。このとき学習は線形モデルに帰着し、
\[f(x) = \sum_i \alpha_i k_{\mathrm{NTK}}(x_i, x)\]
の形を取る。これは深層モデルとカーネル法の接続を示す。
深層ネットワークは高い表現能力を持つにもかかわらず、適切な条件下で良好な一般化性能を示す。この理由として:
などが挙げられる。
各層は異なる抽象度の特徴を抽出する:
この階層性は視覚・言語など多様なタスクで観測される。
関数合成は圏論における射の合成として理解できる。ニューラルネットワークは対象(空間)と射(写像)の系列として表現され、モノイド的構造や関手的解釈が可能である。
深層構造は、関数の逐次的合成として理解することで、その表現能力・幾何学・最適化特性を統一的に説明できる。浅いモデルとの本質的な違いは「深さ」による表現効率と構造適合性にあり、組成的関数に対して特に強力である。この関数合成の観点は、現代の深層学習理論の中心的枠組みをなすものである。
Mathematics is the language with which God has written the universe.