関数合成としての深層構造

深層表現の理論における「関数合成としての深層構造」とは、多層ニューラルネットワークを単なる計算モデルとしてではなく、関数の逐次的合成として捉えることにより、その表現能力・一般化性能・幾何学的性質を厳密に理解しようとする枠組みである。この観点では、深層ネットワークは単一の複雑な関数ではなく、比較的単純な写像の合成

\[f = f_L \circ f_{L-1} \circ \cdots \circ f_1\]

として構成される階層的構造を持つ関数族であると理解される。

基本設定:関数合成としてのネットワーク

入力空間 $\mathcal{X} \subset \mathbb{R}^{d_0}$ から出力空間 $\mathcal{Y}$ への写像として、深層ネットワークは各層の写像

\[f_l : \mathbb{R}^{d_{l-1}} \to \mathbb{R}^{d_l}\]

の合成として定義される。典型的には

\[f_l(x) = \sigma_l(W_l x + b_l)\]

であり、全体として

\[f(x) = f_L \circ \cdots \circ f_1 (x)\]

となる。この構造は「階層的特徴抽出」として解釈される。

関数クラスとしての深層モデル

深層ネットワークは、関数空間における特定の部分集合

\[\mathcal{F}_{\mathrm{deep}} = \{f_L \circ \cdots \circ f_1 \mid f_l \in \mathcal{G}_l\}\]

を定義する。このクラスは浅いモデル(例えば単層ネットワーク)とは異なる幾何学的・近似論的性質を持つ。

表現能力と深さの役割

普遍近似定理により浅いネットワークでも任意の連続関数を近似可能であるが、深層構造はより効率的な表現を可能にする。すなわち、ある関数 $f$ に対し:

  • 浅いネットワークでは指数的に多くのユニットが必要
  • 深いネットワークでは多項式的なサイズで実現可能

となる場合が存在する。これは関数の「合成構造」を利用しているためである。

階層的構造と組成的関数

多くの実世界の関数は組成的(compositional)構造を持つ:

\[f(x_1,\dots,x_d)= g\bigl(h_1(x_{I_1}), \dots, h_k(x_{I_k})\bigr)\]

ここで各 $h_i$ は低次元関数である。このような構造に対して深層ネットワークは自然に適合する。

線形領域分割と表現の幾何

ReLUネットワークは入力空間を多数の線形領域に分割し、それぞれで線形関数として振る舞う。この領域数は深さに対して指数的に増加しうるため、深層構造は複雑な非線形関数を効率的に表現できる。

関数合成と微分構造

合成関数の微分は連鎖律により

\[Df(x) = Df_L \cdot Df_{L-1} \cdots Df_1\]

と表される。この積構造は勾配消失・爆発の原因であり、同時に特徴変換の幾何学的性質(ヤコビアンのスペクトル)を支配する。

作用素論的視点

各層は関数空間上の作用素とみなせる。特に線形変換 $W_l$ は有界線形作用素、活性化関数は非線形作用素である。深層ネットワークはこれらの作用素の合成として理解される。

情報論的解釈

深層構造は情報の圧縮と再表現の過程としても理解される。中間層は入力の冗長性を削減し、タスクに関連する情報を強調する。情報ボトルネック原理により、

\[I(X;H_l) \downarrow, \quad I(H_l;Y) \uparrow\]

という傾向が議論される。

カーネル極限とNTK

幅が無限大に近づく極限では、ネットワークはニューラルタンジェントカーネル(NTK)により記述される。このとき学習は線形モデルに帰着し、

\[f(x) = \sum_i \alpha_i k_{\mathrm{NTK}}(x_i, x)\]

の形を取る。これは深層モデルとカーネル法の接続を示す。

深さと一般化

深層ネットワークは高い表現能力を持つにもかかわらず、適切な条件下で良好な一般化性能を示す。この理由として:

  • 暗黙的正則化(SGDの性質)
  • 低ランク構造やスパース性
  • 関数クラスの有効自由度の低さ

などが挙げられる。

階層的特徴表現

各層は異なる抽象度の特徴を抽出する:

  • 浅い層:局所的・低次特徴
  • 深い層:抽象的・意味的特徴

この階層性は視覚・言語など多様なタスクで観測される。

圏論的・関数的視点

関数合成は圏論における射の合成として理解できる。ニューラルネットワークは対象(空間)と射(写像)の系列として表現され、モノイド的構造や関手的解釈が可能である。

まとめ

深層構造は、関数の逐次的合成として理解することで、その表現能力・幾何学・最適化特性を統一的に説明できる。浅いモデルとの本質的な違いは「深さ」による表現効率と構造適合性にあり、組成的関数に対して特に強力である。この関数合成の観点は、現代の深層学習理論の中心的枠組みをなすものである。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習