統計的学習理論は、有限個の標本から未知の確率分布に基づく予測関数を構成し、その汎化性能を理論的に評価する枠組みである。経験誤差最小化と汎化誤差の関係を中心に、仮説空間の複雑さと過学習のトレードオフを定量化する点に本質がある。
学習のパラダイムは大きく二つに分類される。教師あり学習(supervised learning)では、入力 $\boldsymbol{x}$ と対応する出力ラベル $y$ の組が訓練データとして与えられ、入出力の対応関係を学習する。回帰(出力が連続値)や分類(出力がカテゴリ)が代表的である。一方、教師なし学習(unsupervised learning)では、ラベルなしの入力のみが与えられ、データの構造・密度・潜在的なクラスタを発見することが目的となる。クラスタリングや密度推定、次元削減がその例である。本稿では主に教師あり学習の枠組みで理論を展開するが、多くの概念(仮説空間、リスク、正則化)は教師なし学習にも自然に拡張される。
入力空間 $\mathcal{X}$、出力空間 $\mathcal{Y}$ を考え、未知の確率分布 $P$ に従う独立同分布(i.i.d.)な標本が与えられているとする:
\[(\boldsymbol{x}_1, y_1), \dots, (\boldsymbol{x}_n, y_n) \;\overset{\text{i.i.d.}}{\sim}\; P(\mathcal{X} \times \mathcal{Y})\]教師あり学習では $\mathcal{Y} = \mathbb{R}$(回帰)あるいは $\mathcal{Y} = \{-1, +1\}$ 等(分類)とする。教師なし学習では出力空間は定義されず、入力の周辺分布 $P(\mathcal{X})$ のみを扱う。
仮説空間(関数クラス)$\mathcal{H}$ の各要素 $f : \mathcal{X} \to \mathcal{Y}$ に対し、損失関数 $\ell : \mathcal{Y} \times \mathcal{Y} \to [0, 1]$ を定義する。以下では損失が有界であること($0 \leq \ell(f(\boldsymbol{x}), y) \leq 1$)を仮定する。この仮定は集中不等式および汎化界の導出において本質的役割を果たす。
| 学習パラダイム | 入力 | 目的 | 代表的タスク |
|---|---|---|---|
| 教師あり学習 | $(\boldsymbol{x}_i, y_i)$ の組 | 入出力対応の学習 | 回帰、分類 |
| 教師なし学習 | $\boldsymbol{x}_i$ のみ | データ構造の発見 | クラスタリング、密度推定 |
| 半教師あり学習 | 少数の $(\boldsymbol{x}_i, y_i)$ + 大量の $\boldsymbol{x}_j$ | 両者の統合利用 | ラベル伝播、自己教師あり |
関数 $f \in \mathcal{H}$ の期待リスクは、分布 $P$ に関する損失の期待値として定義される:
\[R(f) = \mathbb{E}_{(\boldsymbol{x}, y) \sim P}\bigl[\ell(f(\boldsymbol{x}), y)\bigr]\]これは未知の分布 $P$ に依存するため直接計算できないが、学習の最終目的はこの量を最小化することである。
標本に基づく経験リスクは:
\[R_n(f) = \frac{1}{n} \sum_{i=1}^{n} \ell(f(\boldsymbol{x}_i), y_i)\]大数の法則により固定された $f$ に対しては $R_n(f) \to R(f)$ が成立するが、問題は仮説空間 $\mathcal{H}$ 全体で一様に成立するかである。この「一様収束」が汎化理論の核心となる。
経験リスク最小化は次の最適化問題として定義される:
\[\hat{f} = \arg\min_{f \in \mathcal{H}} R_n(f)\]これは教師あり学習の基本原理であり、最小二乗法やロジスティック回帰などはその具体例である。しかし、$\mathcal{H}$ が過度に複雑である場合、訓練誤差は小さくても汎化誤差が大きくなる過学習が生じる。
最適関数 $f^*$ を:
\[f^* = \arg\min_{f} R(f)\]とすると、過剰リスクは次のように分解される:
\[R(\hat{f}) - R(f^*) =\underbrace{\left(\inf_{f \in \mathcal{H}} R(f) - R(f^*)\right)}_{\text{近似誤差}}+\underbrace{\left(R(\hat{f}) - \inf_{f \in \mathcal{H}} R(f)\right)}_{\text{推定誤差}}\]近似誤差はモデルの表現能力に起因し、推定誤差は有限標本による統計的ゆらぎに起因する。この二つのバランスがバイアス–分散トレードオフである。
統計的学習理論の中心課題は:
\[\sup_{f \in \mathcal{H}} |R(f) - R_n(f)|\]を評価することである。この量が小さければ、経験リスク最小化は汎化性能を保証する。
VC 次元は仮説クラスの表現能力を測る指標であり、以下の汎化界が成立する:
\[R(f) \leq R_n(f) + \sqrt{\frac{2d \log(en/d) + 2\log(2/\delta)}{n}}\]ラデマッハ複雑度は標本依存の複雑度であり:
\[\mathfrak{R}_n(\mathcal{H}) =\mathbb{E}_{\boldsymbol{\sigma}}\!\left[\sup_{f \in \mathcal{H}}\frac{1}{n} \sum_{i=1}^{n} \sigma_i f(\boldsymbol{x}_i)\right]\]これにより次の汎化界が得られる:
\[R(f) \leq R_n(f) + 2\mathfrak{R}_n(\mathcal{H}) + \sqrt{\frac{\log(1/\delta)}{2n}}\]正則化はモデルの複雑さを制御し、過学習を抑制する役割を持つ。
SRM は理論的汎化界に基づいてモデルの複雑さを選択する原理である。
統計的学習理論は、期待リスクと経験リスクの差を制御することで汎化性能を保証する理論体系である。仮説空間の複雑さを適切に制御することで、有限標本からでも信頼できる予測が可能となる。
| 概念 | 役割 | 主要な結果 |
|---|---|---|
| VC 次元 | 仮説クラスの複雑さ | 汎化界 |
| ラデマッハ複雑度 | 標本依存の複雑さ | より精密な汎化界 |
| 近似誤差 | モデル表現能力の限界 | バイアス |
| 推定誤差 | 有限標本の影響 | 分散 |
| 正則化 | 過学習の抑制 | トレードオフ制御 |
| SRM | モデル選択原理 | 理論的最適化 |
Mathematics is the language with which God has written the universe.