カーネル正準相関分析(KCCA)

カーネル正準相関分析(Kernel Canonical Correlation Analysis, KCCA)は、2つの確率変数(あるいはデータ集合)間の相関構造を抽出する正準相関分析(CCA)を非線形に拡張した手法であり、それぞれの入力を再生核ヒルベルト空間(RKHS)に写像した上で相関最大化を行う方法である。カーネルトリックにより高次元(しばしば無限次元)の特徴空間を明示的に構成することなく、非線形な依存関係を抽出できる点に本質がある。

基本設定と確率論的枠組み

データ集合

\[\{x_1, \dots, x_n\} \subset \mathbb{R}^{d_x}, \quad\{y_1, \dots, y_n\} \subset \mathbb{R}^{d_y}\]

を考える。これらは確率変数 $(X,Y)$ の独立同分布標本とみなす。対応する特徴写像

\[\phi : \mathbb{R}^{d_x} \to \mathcal{H}_x,\quad\psi : \mathbb{R}^{d_y} \to \mathcal{H}_y\]

を導入する。ただし $\mathcal{H}_x, \mathcal{H}_y$ はそれぞれ正定値カーネル $k_x, k_y$ に対応するRKHSである。理論的には $\mathbb{E}\|\phi(X)\|^2 < \infty$, $\mathbb{E}\|\psi(Y)\|^2 < \infty$ を仮定する。

RKHSにおける正準相関問題

KCCAは次の最適化問題として定式化される:

\[\max_{f \in \mathcal{H}_x,\, g \in \mathcal{H}_y}\frac{\mathrm{Cov}(f(X), g(Y))}{\sqrt{\mathrm{Var}(f(X))\,\mathrm{Var}(g(Y))}}\]

ここで $f,g$ はそれぞれのRKHSに属する関数であり、平均はゼロ(中心化済み)と仮定する。この問題は、RKHS上の共分散作用素を用いた最大相関問題である。

共分散作用素による定式化

RKHS上の共分散作用素を

\[C_{xx} = \mathbb{E}[\tilde{\phi}(X)\otimes \tilde{\phi}(X)],\quad C_{yy} = \mathbb{E}[\tilde{\psi}(Y)\otimes \tilde{\psi}(Y)]\]

\[C_{xy} = \mathbb{E}[\tilde{\phi}(X)\otimes \tilde{\psi}(Y)]\]

と定義する。このときKCCAは作用素の観点から

\[\max_{f,g} \frac{\langle f, C_{xy} g\rangle}{\sqrt{\langle f, C_{xx} f\rangle \,\langle g, C_{yy} g\rangle}}\]

と書ける。これは作用素 $C_{xx}^{-1/2} C_{xy} C_{yy}^{-1/2}$ の最大特異値問題に対応する。

表現定理と有限次元化

Representer theoremにより最適解は有限和で表される:

\[f(\cdot) = \sum_{i=1}^n \alpha_i k_x(x_i, \cdot), \quad g(\cdot) = \sum_{i=1}^n \beta_i k_y(y_i, \cdot)\]

これにより問題は有限次元の係数ベクトル $\alpha,\beta$ に帰着される。

カーネル行列と中心化

カーネル行列を

\[(K_x)_{ij} = k_x(x_i,x_j),\quad(K_y)_{ij} = k_y(y_i,y_j)\]

とする。中心化は

\[\tilde{K}_x = H K_x H,\quad\tilde{K}_y = H K_y H,\quad H = I - \frac{1}{n}\mathbf{1}\mathbf{1}^T\]

により行う。

経験的目的関数の導出

経験的共分散および分散は以下で与えられる:

\[\mathrm{Cov}(f(x), g(y)) = \frac{1}{n} \alpha^T \tilde{K}_x \tilde{K}_y \beta\]

\[\mathrm{Var}(f(x)) = \frac{1}{n} \alpha^T \tilde{K}_x^2 \alpha,\quad\mathrm{Var}(g(y)) = \frac{1}{n} \beta^T \tilde{K}_y^2 \beta\]

したがって最適化問題は

\[\max_{\alpha,\beta}\frac{\alpha^T \tilde{K}_x \tilde{K}_y \beta}{\sqrt{\alpha^T \tilde{K}_x^2 \alpha \;\beta^T \tilde{K}_y^2 \beta}}\]

となる。

正則化と安定化

有限標本では $\tilde{K}_x, \tilde{K}_y$ は一般に特異であり、また過学習を防ぐ必要があるため正則化を導入する。代表的には

\[\tilde{K}_x^2 \;\to\; \tilde{K}_x^2 + \kappa \tilde{K}_x,\quad\tilde{K}_y^2 \;\to\; \tilde{K}_y^2 + \kappa \tilde{K}_y\]

あるいは

\[\tilde{K}_x \to \tilde{K}_x + \kappa I,\quad\tilde{K}_y \to \tilde{K}_y + \kappa I\]

の形でリッジ型正則化を行う。この選択は数値安定性と統計的一貫性に影響する。

一般化固有値問題

ラグランジュ未定乗数法により、最適化問題は次の一般化固有値問題に帰着する:

\[\tilde{K}_x \tilde{K}_y \beta = \lambda (\tilde{K}_x^2 + \kappa \tilde{K}_x)\alpha\]

\[\tilde{K}_y \tilde{K}_x \alpha = \lambda (\tilde{K}_y^2 + \kappa \tilde{K}_y)\beta\]

これらはブロック形式で

\[\begin{pmatrix}0 & \tilde{K}_x \tilde{K}_y \\\tilde{K}_y \tilde{K}_x & 0\end{pmatrix}\begin{pmatrix}\alpha \\ \beta\end{pmatrix}=\lambda\begin{pmatrix}\tilde{K}_x^2 + \kappa \tilde{K}_x & 0 \\0 & \tilde{K}_y^2 + \kappa \tilde{K}_y\end{pmatrix}\begin{pmatrix}\alpha \\ \beta\end{pmatrix}\]

と書ける。

正準変数(射影)

新しいデータ $(x,y)$ に対する正準変数は

\[f(x) = \sum_{i=1}^n \alpha_i \tilde{k}_x(x_i, x),\quad g(y) = \sum_{i=1}^n \beta_i \tilde{k}_y(y_i, y)\]

で与えられる。ここでも中心化カーネルを用いることが重要である。

アルゴリズム

  • カーネル行列 $K_x, K_y$ を構成
  • 中心化して $\tilde{K}_x, \tilde{K}_y$ を得る
  • 正則化項を加える
  • 一般化固有値問題を解く
  • 最大固有値に対応する $(\alpha,\beta)$ を取得

通常のCCAとの関係

線形カーネルを用いると $\phi(x)=x$, $\psi(y)=y$ に対応し、KCCAは通常のCCAと一致する。したがってKCCAはCCAの自然な非線形拡張である。

統計的一貫性と過学習

KCCAは高次元(特に無限次元)特徴空間を扱うため、正則化なしでは容易に相関が1に近づく(過学習)問題がある。このため正則化パラメータ $\kappa$ の選択は極めて重要であり、交差検証などで決定される。

関連手法との関係

KCCAは以下の手法と密接に関連する:

  • Hilbert-Schmidt Independence Criterion(HSIC):独立性検定(KCCAのノルム版)
  • 深層CCA:ニューラルネットワークによる非線形写像
  • 多視点学習(multi-view learning)

まとめ

カーネル正準相関分析は、2つのデータ集合間の非線形相関構造を抽出するために、RKHS上で正準相関問題を解く手法である。共分散作用素の特異値分解として理論的に定式化され、計算上はカーネル行列に基づく一般化固有値問題として実装される。正則化と中心化が不可欠であり、高次元データにおける依存構造解析の基盤的手法として重要である。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習