カーネル正準相関分析(Kernel Canonical Correlation Analysis, KCCA)は、2つの確率変数(あるいはデータ集合)間の相関構造を抽出する正準相関分析(CCA)を非線形に拡張した手法であり、それぞれの入力を再生核ヒルベルト空間(RKHS)に写像した上で相関最大化を行う方法である。カーネルトリックにより高次元(しばしば無限次元)の特徴空間を明示的に構成することなく、非線形な依存関係を抽出できる点に本質がある。
データ集合
\[\{x_1, \dots, x_n\} \subset \mathbb{R}^{d_x}, \quad\{y_1, \dots, y_n\} \subset \mathbb{R}^{d_y}\]
を考える。これらは確率変数 $(X,Y)$ の独立同分布標本とみなす。対応する特徴写像
\[\phi : \mathbb{R}^{d_x} \to \mathcal{H}_x,\quad\psi : \mathbb{R}^{d_y} \to \mathcal{H}_y\]
を導入する。ただし $\mathcal{H}_x, \mathcal{H}_y$ はそれぞれ正定値カーネル $k_x, k_y$ に対応するRKHSである。理論的には $\mathbb{E}\|\phi(X)\|^2 < \infty$, $\mathbb{E}\|\psi(Y)\|^2 < \infty$ を仮定する。
KCCAは次の最適化問題として定式化される:
\[\max_{f \in \mathcal{H}_x,\, g \in \mathcal{H}_y}\frac{\mathrm{Cov}(f(X), g(Y))}{\sqrt{\mathrm{Var}(f(X))\,\mathrm{Var}(g(Y))}}\]
ここで $f,g$ はそれぞれのRKHSに属する関数であり、平均はゼロ(中心化済み)と仮定する。この問題は、RKHS上の共分散作用素を用いた最大相関問題である。
RKHS上の共分散作用素を
\[C_{xx} = \mathbb{E}[\tilde{\phi}(X)\otimes \tilde{\phi}(X)],\quad C_{yy} = \mathbb{E}[\tilde{\psi}(Y)\otimes \tilde{\psi}(Y)]\]
\[C_{xy} = \mathbb{E}[\tilde{\phi}(X)\otimes \tilde{\psi}(Y)]\]
と定義する。このときKCCAは作用素の観点から
\[\max_{f,g} \frac{\langle f, C_{xy} g\rangle}{\sqrt{\langle f, C_{xx} f\rangle \,\langle g, C_{yy} g\rangle}}\]
と書ける。これは作用素 $C_{xx}^{-1/2} C_{xy} C_{yy}^{-1/2}$ の最大特異値問題に対応する。
Representer theoremにより最適解は有限和で表される:
\[f(\cdot) = \sum_{i=1}^n \alpha_i k_x(x_i, \cdot), \quad g(\cdot) = \sum_{i=1}^n \beta_i k_y(y_i, \cdot)\]
これにより問題は有限次元の係数ベクトル $\alpha,\beta$ に帰着される。
カーネル行列を
\[(K_x)_{ij} = k_x(x_i,x_j),\quad(K_y)_{ij} = k_y(y_i,y_j)\]
とする。中心化は
\[\tilde{K}_x = H K_x H,\quad\tilde{K}_y = H K_y H,\quad H = I - \frac{1}{n}\mathbf{1}\mathbf{1}^T\]
により行う。
経験的共分散および分散は以下で与えられる:
\[\mathrm{Cov}(f(x), g(y)) = \frac{1}{n} \alpha^T \tilde{K}_x \tilde{K}_y \beta\]
\[\mathrm{Var}(f(x)) = \frac{1}{n} \alpha^T \tilde{K}_x^2 \alpha,\quad\mathrm{Var}(g(y)) = \frac{1}{n} \beta^T \tilde{K}_y^2 \beta\]
したがって最適化問題は
\[\max_{\alpha,\beta}\frac{\alpha^T \tilde{K}_x \tilde{K}_y \beta}{\sqrt{\alpha^T \tilde{K}_x^2 \alpha \;\beta^T \tilde{K}_y^2 \beta}}\]
となる。
有限標本では $\tilde{K}_x, \tilde{K}_y$ は一般に特異であり、また過学習を防ぐ必要があるため正則化を導入する。代表的には
\[\tilde{K}_x^2 \;\to\; \tilde{K}_x^2 + \kappa \tilde{K}_x,\quad\tilde{K}_y^2 \;\to\; \tilde{K}_y^2 + \kappa \tilde{K}_y\]
あるいは
\[\tilde{K}_x \to \tilde{K}_x + \kappa I,\quad\tilde{K}_y \to \tilde{K}_y + \kappa I\]
の形でリッジ型正則化を行う。この選択は数値安定性と統計的一貫性に影響する。
ラグランジュ未定乗数法により、最適化問題は次の一般化固有値問題に帰着する:
\[\tilde{K}_x \tilde{K}_y \beta = \lambda (\tilde{K}_x^2 + \kappa \tilde{K}_x)\alpha\]
\[\tilde{K}_y \tilde{K}_x \alpha = \lambda (\tilde{K}_y^2 + \kappa \tilde{K}_y)\beta\]
これらはブロック形式で
\[\begin{pmatrix}0 & \tilde{K}_x \tilde{K}_y \\\tilde{K}_y \tilde{K}_x & 0\end{pmatrix}\begin{pmatrix}\alpha \\ \beta\end{pmatrix}=\lambda\begin{pmatrix}\tilde{K}_x^2 + \kappa \tilde{K}_x & 0 \\0 & \tilde{K}_y^2 + \kappa \tilde{K}_y\end{pmatrix}\begin{pmatrix}\alpha \\ \beta\end{pmatrix}\]
と書ける。
新しいデータ $(x,y)$ に対する正準変数は
\[f(x) = \sum_{i=1}^n \alpha_i \tilde{k}_x(x_i, x),\quad g(y) = \sum_{i=1}^n \beta_i \tilde{k}_y(y_i, y)\]
で与えられる。ここでも中心化カーネルを用いることが重要である。
線形カーネルを用いると $\phi(x)=x$, $\psi(y)=y$ に対応し、KCCAは通常のCCAと一致する。したがってKCCAはCCAの自然な非線形拡張である。
KCCAは高次元(特に無限次元)特徴空間を扱うため、正則化なしでは容易に相関が1に近づく(過学習)問題がある。このため正則化パラメータ $\kappa$ の選択は極めて重要であり、交差検証などで決定される。
KCCAは以下の手法と密接に関連する:
カーネル正準相関分析は、2つのデータ集合間の非線形相関構造を抽出するために、RKHS上で正準相関問題を解く手法である。共分散作用素の特異値分解として理論的に定式化され、計算上はカーネル行列に基づく一般化固有値問題として実装される。正則化と中心化が不可欠であり、高次元データにおける依存構造解析の基盤的手法として重要である。
Mathematics is the language with which God has written the universe.