最大平均偏差(Maximum Mean Discrepancy, MMD)は、2つの確率分布の差異を再生核ヒルベルト空間(RKHS)上の平均埋め込みの距離として測る指標であり、関数クラスに基づく積分確率距離(Integral Probability Metric, IPM)の一種として定式化される非パラメトリック手法である。特に、カーネル法に基づく分布比較・二標本検定・生成モデルの評価・分布整合などに広く用いられる。
可測空間 $(\mathcal{X}, \mathcal{F})$ 上の確率分布 $P, Q$ を考える。対称正定値カーネル
\[k : \mathcal{X} \times \mathcal{X} \to \mathbb{R}\]
に対応するRKHS $\mathcal{H}$ を考える。このとき、以下の可積分性条件を仮定することが重要である:
\[\mathbb{E}_{X \sim P}[\sqrt{k(X,X)}] < \infty,\quad\mathbb{E}_{Y \sim Q}[\sqrt{k(Y,Y)}] < \infty\]
この条件により、後述のカーネル平均埋め込みがヒルベルト空間内で良定義となる。
分布 $P$ のカーネル平均埋め込みはボホナー積分として
\[\mu_P := \mathbb{E}_{X \sim P}[\,k(X, \cdot)\,] \in \mathcal{H}\]
で定義される。同様に $Q$ に対して $\mu_Q$ を定義する。
再生性より任意の $f \in \mathcal{H}$ に対して
\[\mathbb{E}_{P}[f(X)] = \langle f, \mu_P \rangle_{\mathcal{H}}\]
が成立する。すなわち、期待値作用素はRKHSの内積として表現される連続線形汎関数である。
MMDは平均埋め込みの距離として
\[\mathrm{MMD}(P,Q):= \|\mu_P - \mu_Q\|_{\mathcal{H}}\]
で定義される。これは次の変分表現と同値である:
\[\mathrm{MMD}(P,Q)= \sup_{\|f\|_{\mathcal{H}} \le 1}\left( \mathbb{E}_{P}[f(X)] - \mathbb{E}_{Q}[f(X)] \right)\]
この表現から、MMDが関数クラス $\{f \in \mathcal{H} : \|f\|_{\mathcal{H}} \le 1\}$ に対するIPMであることが明確になる。
内積の双線形性と再生性を用いると、二乗MMDは以下のように展開される:
\[\mathrm{MMD}^2(P,Q)= \|\mu_P\|^2 + \|\mu_Q\|^2 - 2\langle \mu_P, \mu_Q \rangle\]
各項はカーネル期待値として書き下せる:
\[\|\mu_P\|^2 = \mathbb{E}_{X,X' \sim P}[k(X,X')],\quad\|\mu_Q\|^2 = \mathbb{E}_{Y,Y' \sim Q}[k(Y,Y')]\]
\[\langle \mu_P, \mu_Q \rangle = \mathbb{E}_{X \sim P, Y \sim Q}[k(X,Y)]\]
したがって
\[\mathrm{MMD}^2(P,Q)= \mathbb{E}_{X,X' \sim P}[k(X,X')]+ \mathbb{E}_{Y,Y' \sim Q}[k(Y,Y')]- 2\,\mathbb{E}_{X \sim P, Y \sim Q}[k(X,Y)]\]
が得られる。
標本 $\{x_i\}_{i=1}^n \sim P$、$\{y_j\}_{j=1}^m \sim Q$ に対して、代表的な推定量は以下の2種類である。
不偏推定量(U統計量):
\[\widehat{\mathrm{MMD}}^2_u=\frac{1}{n(n-1)} \sum_{i \ne j} k(x_i,x_j)+\frac{1}{m(m-1)} \sum_{i \ne j} k(y_i,y_j)-\frac{2}{nm} \sum_{i,j} k(x_i,y_j)\]
バイアスあり推定量(V統計量):
\[\widehat{\mathrm{MMD}}^2_b=\frac{1}{n^2} \sum_{i,j} k(x_i,x_j)+\frac{1}{m^2} \sum_{i,j} k(y_i,y_j)-\frac{2}{nm} \sum_{i,j} k(x_i,y_j)\]
前者は不偏であるが分散が大きく、後者はわずかなバイアスを持つが分散が小さいというトレードオフがある。さらに、計算量 $O(n^2)$ を削減する線形時間推定量(ランダムペアリングによる推定)も存在する。
カーネル $k$ が特性カーネル(characteristic kernel)であるとは、写像
\[P \mapsto \mu_P\]
が単射であることをいう。このとき
\[\mathrm{MMD}(P,Q) = 0 \;\Longleftrightarrow\; P = Q\]
が成立する。ガウスカーネルやラプラスカーネルは典型的な特性カーネルであり、特に平行移動不変カーネルに対してはスペクトル測度が台全体に広がることが特徴性と関係する(Bochnerの定理)。
特性カーネルに対して、MMDは分布の弱収束と密接に関係する。すなわち、適切なカーネル(例:有界連続カーネル)に対しては
\[\mathrm{MMD}(P_n, P) \to 0 \;\Longleftrightarrow\; P_n \Rightarrow P\]
が成立する。したがって、MMDは分布収束を距離として特徴付ける指標となる。
写像
\[\mu : \mathcal{P}(\mathcal{X}) \to \mathcal{H}, \quad P \mapsto \mu_P\]
は確率測度のRKHSへの埋め込みであり、MMDはその像空間におけるヒルベルトノルムである。このとき、期待値作用素
\[T_P : f \mapsto \mathbb{E}_P[f]\]
は $\mathcal{H}$ 上の連続線形汎関数であり、リースの表現定理により $\mu_P$ に対応する。したがって、MMDは作用素差 $T_P - T_Q$ のノルムに対応する量でもある。
MMDは二標本検定における統計量として用いられる。帰無仮説
\[H_0 : P = Q\]
のもとで、不偏推定量は退化U統計量となり、その漸近分布は無限次元カイ二乗型分布(固有値展開に基づく)に従う。このため実務では、置換検定やブートストラップによる近似が広く用いられる。
MMDはIPMの枠組み
\[\sup_{f \in \mathcal{F}} (\mathbb{E}_P[f] - \mathbb{E}_Q[f])\]
において $\mathcal{F}$ をRKHSの単位球としたものである。これに対し:
など、関数クラスの違いが距離の性質(感度・幾何構造)を決定する。
MMDは以下の用途で用いられる:
実務上はカーネルの選択(特にガウスカーネルの帯域幅)が性能を大きく左右する。代表的にはmedian heuristicが用いられるが、複数スケールのカーネルを組み合わせることも有効である。また、高次元ではカーネル値の集中現象により識別力が低下する場合があるため注意が必要である。
最大平均偏差は、確率分布をRKHSに埋め込み、その差をヒルベルトノルムとして測ることで分布間距離を定義する手法である。IPMの一種として理論的に位置づけられ、特性カーネルを用いることで分布の同一性判定が可能となる。さらに、測度論・作用素論・統計的推定の観点が統合された枠組みであり、計算可能性と理論的厳密性を兼ね備えた分布比較手法として、現代機械学習において重要な役割を担っている。
Mathematics is the language with which God has written the universe.