線形モデルとしての分散分析(回帰分析との等価性)

分散分析(ANOVA)は歴史的には「群平均の比較」として導入されたが、その本質は一般線形モデル(General Linear Model; GLM)の特殊な場合である。すなわち、分散分析と回帰分析は同一の数理構造を持ち、いずれも線形空間における射影と二次形式(平方和)の分解として統一的に理解される。

この観点に立つと、分散分析におけるF検定は、回帰分析における「制約付きモデルと非制約モデルの比較」と完全に一致する。

一般線形モデルの定式化

観測ベクトル $\mathbf{y} \in \mathbb{R}^N$ に対し、一般線形モデルは

\[\mathbf{y} = X\boldsymbol{\beta} + \boldsymbol{\varepsilon}\]

と書かれる。ここで、

  • $X \in \mathbb{R}^{N \times p}$:デザイン行列
  • $\boldsymbol{\beta} \in \mathbb{R}^p$:回帰係数
  • $\boldsymbol{\varepsilon} \sim \mathcal{N}(\mathbf{0}, \sigma^2 I)$:誤差項

とする。このモデルにおいて、最小二乗推定量は

\[\hat{\boldsymbol{\beta}} = (X^\top X)^{-1} X^\top \mathbf{y}\]

で与えられる($X^\top X$ が可逆である場合)。

対応する予測値は

\[\hat{\mathbf{y}} = X \hat{\boldsymbol{\beta}} = P_X \mathbf{y}\]

であり、ここで

\[P_X = X (X^\top X)^{-1} X^\top\]

は $X$ の列空間への直交射影行列である。

平方和の分解と幾何学

観測ベクトルは以下のように直交分解される:

\[\mathbf{y} = \hat{\mathbf{y}} + \mathbf{e}\]

ここで $\mathbf{e} = \mathbf{y} - \hat{\mathbf{y}}$ は残差である。このとき、ノルムの分解

\[\|\mathbf{y}\|^2 = \|\hat{\mathbf{y}}\|^2 + \|\mathbf{e}\|^2\]

が成立する。

平均中心化を考えると、分散分析における平方和分解

\[\mathrm{SST} = \mathrm{SSR} + \mathrm{SSE}\]

と一致する。ここで、

  • SST:総平方和(全変動)
  • SSR:回帰平方和(モデルによる説明変動)
  • SSE:残差平方和(誤差)

である。

分散分析モデルの回帰表現

例えば一元配置分散分析は、ダミー変数を用いた回帰モデルとして表現できる。$k$ 群の場合、

\[y_n = \beta_0 + \beta_1 d_{1n} + \cdots + \beta_{k-1} d_{(k-1)n} + \varepsilon_n\]

と書ける。ここで $d_{in}$ は群を表すダミー変数である。

このモデルは、

\[y_n = \mu + \alpha_i + \varepsilon_n\]

という分散分析モデルと同値であり、係数 $\beta$ と効果 $\alpha_i$ は線形変換で対応する。

したがって、ANOVAは「カテゴリカル変数を説明変数とする回帰分析」とみなすことができる。

F検定の統一的理解

一般線形モデルにおいて、仮説

\[H_0 : R\boldsymbol{\beta} = \mathbf{0}\]

を検定する場合、制約付きモデルと非制約モデルの残差平方和を比較することでF統計量が構成される:

\[F = \frac{(\mathrm{SSE}_0 - \mathrm{SSE}_1)/q}{\mathrm{SSE}_1/(N-p)}\]

ここで、

  • $\mathrm{SSE}_0$:制約付きモデルの残差平方和
  • $\mathrm{SSE}_1$:完全モデルの残差平方和
  • $q$:制約の数

である。

この式は分散分析における

\[F = \frac{\mathrm{MSB}}{\mathrm{MSW}}\]

と完全に一致する。すなわち、分散分析のF検定は、回帰における一般線形仮説の検定の特殊例である。

部分空間と射影の観点

デザイン行列 $X$ の列空間 $\mathcal{C}(X)$ を考えると、モデルはこの部分空間への射影として解釈される。異なるモデルは異なる部分空間に対応する。

制約付きモデルは部分空間 $\mathcal{C}(X_0)$、完全モデルは $\mathcal{C}(X_1)$ に対応し、

\[\mathcal{C}(X_0) \subset \mathcal{C}(X_1)\]

が成立する。このとき、平方和の差

\[\mathrm{SSE}_0 - \mathrm{SSE}_1\]

は、2つの部分空間の差に対応する直交成分のノルムとして解釈される。

二元配置・高次元への拡張

二元配置分散分析や交互作用モデルも、同様に適切なデザイン行列を構成することで回帰モデルとして表現できる。例えば、

  • 主効果:各因子のダミー変数
  • 交互作用:ダミー変数の積

として実装される。

この統一的枠組みにより、ANOVA、回帰分析、共分散分析(ANCOVA)はすべて同一の理論のもとで扱われる。

まとめ

分散分析は、一般線形モデルの特別な場合として理解され、回帰分析と本質的に等価である。平方和の分解は線形空間における直交射影の結果として導かれ、F検定は部分空間間の差の大きさを測る統計量として解釈される。

この統一的理解により、カテゴリカル変数・連続変数を問わず、統計モデルはすべて同一の枠組みで扱うことが可能となり、現代統計学の基盤を形成している。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習