表現能力と近似定理

深層学習における「表現能力と近似定理」とは、ニューラルネットワークがどのような関数クラスをどの程度の精度で近似できるか、さらにその際に必要となる計算資源(幅・深さ・パラメータ数)がどのようにスケールするかを厳密に特徴づける理論的枠組みである。この問題は、関数解析・近似理論・調和解析・統計学習理論の交差点に位置し、単なる「近似可能性」ではなく、「近似効率」「次元依存性」「構造適合性」を含めて理解する必要がある。

基本設定と誤差の分解

コンパクト集合 $K \subset \mathbb{R}^d$ 上の目標関数 $f^\ast : K \to \mathbb{R}$ を考える。ニューラルネットワークの関数クラス $\mathcal{F}$ に対して、近似問題は

\[\inf_{f \in \mathcal{F}} \|f - f^\ast\|_{L^p(K)} \quad \text{または} \quad \|f - f^\ast\|_{\infty}\]

として定式化される。統計的学習の文脈では、観測データに基づく学習器 $\hat{f}$ の誤差は通常

\[\mathbb{E}[(\hat{f}(X)-f^\ast(X))^2] = \underbrace{\inf_{f \in \mathcal{F}}\|f-f^\ast\|^2}_{\text{近似誤差}} + \underbrace{\|\hat{f}-f\|^2}_{\text{推定誤差}} + \text{最適化誤差}\]

に分解される。したがって表現能力とは、このうち近似誤差をどこまで小さくできるかに対応する。

普遍近似定理の精密化

古典的な普遍近似定理は、非多項式な活性化関数 $\sigma$ を持つ単一隠れ層ネットワークが $C(K)$ において稠密であることを主張する。すなわち

\[\overline{\mathrm{span}\{\sigma(w^\top x + b)\}} = C(K)\]

が成立する。この結果は、Stone–Weierstrass型の近似定理の非線形拡張とみなすことができる。しかしこの定理は、必要なユニット数 $n$ がどのように誤差 $\varepsilon$ に依存するかを与えない。

近似率と次元の呪い

より詳細な評価として、$s$ 回微分可能な関数クラス(Sobolev空間 $W^{s,\infty}$)に対する近似率が知られている。幅 $n$ の浅いネットワークによる最良近似誤差は一般に

\[\inf_{f_n} \|f_n - f^\ast\|_{\infty} = O(n^{-s/d})\]

となる。この式に現れる $d$ は入力次元であり、次元が増大すると収束が著しく遅くなる。これが「次元の呪い」である。

深さによる指数的改善(Depth Separation)

深層ネットワークの本質的利点は、単なる近似可能性ではなく「効率」にある。特定の関数クラス $\mathcal{G}$ に対して、以下が成立することが知られている:

  • 任意の浅いネットワークで $\varepsilon$ 精度を達成するには指数的サイズが必要
  • 適切な深さを持つネットワークでは多項式サイズで達成可能

この種の結果は depth separation と呼ばれ、例えば以下のような関数で成立する:

  • 多重合成関数 $f = f_L \circ \cdots \circ f_1$
  • 高周波成分を持つ関数
  • 特定のブール関数(パリティ関数など)

この現象は、深さが「計算回路の深さ」として機能し、再利用と分解を可能にすることに由来する。

ReLUネットワークの近似理論

ReLU活性化 $\sigma(x)=\max(0,x)$ を用いたネットワークは区分線形関数を生成する。$L$ 層・幅 $m$ のネットワークが生成する関数は、入力空間を高々 $O(m^L)$ 個の線形領域に分割する。この指数的分割能力により、複雑な関数を少ないパラメータで近似できる。

さらに、ReLUネットワークは以下の性質を持つ:

  • $L^p$ 空間における可測関数の近似可能性
  • 有界変動関数やLipchitz関数に対する近似保証
  • 深さを増すことで近似誤差を指数的に減少させる構成的結果

組成的関数と有効次元

関数が組成構造

\[f(x) = g(h_1(x_{I_1}), \dots, h_k(x_{I_k}))\]

を持つ場合、深層ネットワークは各部分関数を個別に近似し、それらを再結合することで全体を近似する。このとき近似誤差は全体次元 $d$ ではなく、有効次元 $d_{\mathrm{eff}} = \max |I_i|$ に依存し、

\[\|f - f^\ast\| = O(n^{-s/d_{\mathrm{eff}}})\]

となる。この結果は、深層ネットワークが「次元の呪い」を回避しうる条件を明確に示す。

Barron空間とフーリエ解析的視点

関数 $f$ のフーリエ変換 $\hat{f}(\omega)$ が

\[\int \|\omega\| |\hat{f}(\omega)| d\omega < \infty\]

を満たすとき、$f$ はBarron空間に属する。このとき単一隠れ層ネットワークでも

\[\|f_n - f^\ast\| = O(1/\sqrt{n})\]

という次元に依存しない近似率が得られる。これは浅いネットワークの有効性を示すが、Barron空間は主に「低周波的」な関数を対象とする。

スペクトルバイアスと周波数分解

実際の学習ダイナミクスでは、ニューラルネットワークは低周波成分から先に学習する傾向(spectral bias)を持つ。この性質は近似理論とは独立ではなく、関数のフーリエ分解とネットワーク構造の対応関係に由来する。深いネットワークは高周波構造の表現にも適しているが、その学習にはより多くのステップが必要となる。

カーネル極限との対比

無限幅極限では、ネットワークは再生核ヒルベルト空間(RKHS)に対応する関数クラスに収束する。このとき近似能力はカーネルにより固定され、特徴学習は行われない。一方、有限幅・有限深さのネットワークでは、層ごとの非線形変換により表現空間自体が変形されるため、より広い関数クラスを効率的に近似できる。

近似理論の構成的結果

近年では、特定の関数(例えば多項式、分岐関数、微分方程式の解)を明示的に構成するネットワークが与えられており、誤差評価とパラメータ数の関係が具体的に示されている。例えば、多項式関数は対数深さのネットワークで効率的に表現可能であり、積演算は深さにより指数的に圧縮される。

近似理論の限界と未解決問題

近似理論は表現能力の上限を与えるが、以下の重要な問題を直接には扱わない:

  • 最適化の収束性(非凸性)
  • 汎化誤差の精密評価
  • 実際のデータ分布に対する適合性

また、どの関数クラスに対して深さが本質的に必要か、どの程度の深さが最適かといった問題は依然として活発な研究対象である。

まとめ

ニューラルネットワークの表現能力は、普遍近似定理により「可能性」としては保証されるが、実際に重要なのは近似効率と構造適合性である。深層構造は、関数の合成性・局所性・低次元性を活用することで、浅いモデルでは達成不可能な効率的近似を実現する。一方で、この理論は統計的・計算的側面と不可分であり、近似理論単独では深層学習の成功を完全には説明しない。したがって、表現能力の理解は、関数解析・情報理論・最適化理論との統合の中で初めて完結するのである。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習