深層学習理論における Depth Efficiency(深さの優位性) とは、「ネットワークを『幅(width)』方向に広げるよりも『深さ(depth)』方向に重ねるほうが、より少ないパラメータ数で指数関数的に高い表現能力を得られる」という理論的特性を指す。これは単なる経験的な事実にとどまらず、関数解析、近似理論、および回路複雑性理論の枠組みにおいて厳密に定式化される概念である。
本質的には、「関数合成による構造制約」が表現効率に与える影響を数学的に明らかにするものであり、その核心は、単なる関数クラスの包含関係の議論ではなく、「特定の関数を近似するために必要な計算資源(パラメータ数やユニット数)のオーダー」において、深さが圧倒的な優位性を生むという点にある。
入力空間 $K \subset \mathbb{R}^d$ 上で、深さ $L$・幅 $m$ のReLUネットワークの関数クラスを $\mathcal{F}(L,m)$ とする。このとき Depth Efficiency は、ある関数族 $\mathcal{G}$ に対して以下のような関係が成立することとして定式化される:
\[\exists g \in \mathcal{G}, \ \exists \varepsilon > 0 \text{ such that } \inf_{f \in \mathcal{F}(L_1, m)} \|f - g\| > \varepsilon\]
である一方で、より深いクラスに対しては
\[\exists f \in \mathcal{F}(L_2, \mathrm{poly}(m)) \text{ such that } \|f - g\| < \varepsilon\]
が成立する(ただし $L_2 > L_1$)。さらに強い形では、浅いネットワークが $\varepsilon$ 近似を達成するために必要な幅が
\[m \geq \exp(c n)\]
のように指数的に下から評価される。
ReLUネットワークの表現能力は、その生成する区分線形関数の分割構造により特徴づけられる。$L$ 層・幅 $m$ のネットワークが生成する関数の線形領域数 $R(L,m)$ は、概ね
\[R(L,m) \geq \Omega(m^L)\]
と下から評価される。一方、深さ $2$ のネットワークでは
\[R(2,m) = O(m^d)\]
程度に制限される。この差は、関数の振動性(oscillation complexity)に対する制約として現れる。
具体的には、符号変化回数や層ごとの折りたたみ構造を考えることで、ある種の高周波関数は浅いネットワークでは近似不可能であることが示される。
深さの優位性は、関数の多変数構造をテンソルとして捉えることでより明確になる。$d$ 変数関数を離散化しテンソル $T \in \mathbb{R}^{n \times \cdots \times n}$ とみなすとき、浅いネットワークはこのテンソルを「低ランク分解」(CP分解)として表現するのに対し、深いネットワークは階層的分解(Tensor Train, Hierarchical Tucker)に対応する。
このとき、あるテンソルに対して:
\[\text{CPランク} = \Omega(\exp(d)), \quad \text{HTランク} = O(\mathrm{poly}(d))\]
が成立する場合が存在する。これは、浅いネットワークでは指数的パラメータが必要である一方、深いネットワークでは多項式で済むことを意味する。
関数 $f = f_L \circ \cdots \circ f_1$ に対して、Sobolevノルムは連鎖律により
\[\|f\|_{W^{s,p}} \leq C \prod_{l=1}^L \|f_l\|_{W^{s,p}}\]
のように評価される。この積構造は、関数の滑らかさや変動が層ごとに分配されることを意味し、複雑な関数を局所的に制御された変換の合成として構成できることを示唆する。
一方、浅いネットワークではこの分解が不可能であり、全体の滑らかさ制約が直接的にパラメータ数に跳ね返る。
関数のフーリエスペクトル $\hat{f}(\omega)$ に対して、深層ネットワークは周波数成分の逐次的変換として理解できる。浅いネットワークでは高周波成分を直接表現する必要があるのに対し、深いネットワークでは低周波変換を繰り返すことで高周波構造を生成できる。
この現象は、関数の振動数に対する必要パラメータ数のスケーリングに現れ、深さが指数的な圧縮を可能にする。
ブール関数のクラスに対する古典的結果では、一定の深さ制約のもとで回路サイズに指数的下界が存在する。ニューラルネットワークは連続値版の回路とみなせるため、同様の下界が成立する。
特に、積関数やパリティ関数の近似において、深さ $O(\log n)$ のネットワークは多項式サイズで実現可能であるのに対し、深さ一定のネットワークでは指数的サイズが必要となる。
高次元空間においては測度集中現象により、ランダム関数は典型的に高い複雑性を持つ。このとき浅いネットワークの関数クラスは「薄い」集合を形成し、多くの関数を近似できない。一方、深層ネットワークは合成構造によりこの制約を緩和し、より広い関数クラスをカバーする。
無限幅極限においてネットワークは線形化され、関数クラスはRKHSに制限される。この場合、深さの効果はカーネルの形状に吸収され、指数的な効率差は現れにくい。したがって、Depth Efficiency は本質的に「有限幅・非線形」レジームにおける現象である。
Depth Efficiency は以下の数学的事実に支えられている:
第一に、関数の合成構造が指数的なパラメータ圧縮を可能にすること。第二に、テンソル分解や回路複雑性において、階層構造が本質的に強力であること。第三に、線形領域分割やフーリエ構造において、深さが関数の振動性と複雑性を効率的に生成すること。
したがって、深さの優位性とは単なる経験則ではなく、関数空間の幾何・代数・解析的構造に根ざした厳密な現象であり、深層学習の理論的基盤を構成する中心概念である。
Mathematics is the language with which God has written the universe.