潜在変数モデル
潜在変数モデル(Latent Variable Models)とは、直接観測されるデータ $x$ の背後に、直接は観測することのできない隠れた変数 $z$ を仮定する確率モデルのこと。このモデルは、観測データの生成プロセスを、まず潜在変数 $z$ がある分布 $p(z)$ に従って生成され、次にその $z$ の値に依存して観測データ $x$ が条件付き分布 $p(x|z)$ から生成されるという二段階の階層構造で捉える。数理的には、観測変数と潜在変数の同時分布 $p(x, z)$ を定義することに相当する。潜在変数モデルを学習する際の最大の課題は、観測データのみに基づいた最尤推定を行うために、潜在変数 $z$ を周辺化した対数尤度を最大化しなければならない点にある。すなわち、パラメータを $\theta$ としたとき、最大化すべき対数尤度は\[\log p(x | \theta) = \log \int p(x, z | \theta) dz\]と記述される。ここで、対数関数の内側に積分や和が含まれているため、通常の指数型分布族のように微分を計算して解析的に解を求めることが極めて困難になる。この計算上の障壁はマージナル尤度の困難性と呼ばれ、これを克服するためにエビデンス下界を最大化するEMアルゴリズムや変分推論といった手法が導入される。
基本設定
潜在変数モデルの解説にあたり、まず観測可能なデータの集合を $X = \{x_1, x_2, \dots, x_N\}$ とし、各データ点 $x_n$ に対応する直接観測できない隠れた変数である潜在変数を $z_n$ と定義する。モデルのパラメータを $\theta$ としたとき、潜在変数モデルの目標は、観測データと潜在変数の同時分布 $p(x, z | \theta)$ を適切に設計し、観測データに対する尤度を最大化するパラメータ $\theta$ を見出すこと、および与えられた $x$ から $z$ の性質を推論することにある。
潜在変数モデル(Latent Variable Model)の数理的定義
潜在変数モデルは、観測データ $x$ の生成プロセスの背後に、特定の構造や意味を持つ潜在変数 $z$ が存在すると仮定する確率モデルである。数理的には、潜在変数の事前分布 $p(z | \theta)$ と、潜在変数を条件とした観測データの生成分布 $p(x | z, \theta)$ の積として、同時分布が $p(x, z | \theta) = p(x | z, \theta)p(z | \theta)$ と定義される。この階層構造により、複雑な観測データの分布を、より単純な分布の組み合わせや、低次元の潜在空間からの写像として表現することが可能になる。
完全データと欠測データの同時分布
統計学の文脈において、観測データ $x$ と潜在変数 $z$ の組 $(x, z)$ は完全データ(complete data)と呼ばれる。一方で、実際に得られる観測データ $x$ のみは不完全データ、あるいは潜在変数が欠落しているという意味で欠測データ(incomplete data)と見なされる。潜在変数モデルの学習とは、本来であれば完全データの対数尤度 $\log p(x, z | \theta)$ を最大化したいものの、実際には $z$ が観測できないため、周辺化によって $z$ の影響を取り除いた不完全データの対数尤度を扱わなければならないという特有の状況を指す。
周辺尤度の導出と積分の壁
観測データ $x$ に対する尤度、すなわち周辺尤度(あるいはマージナル尤度)は、同時分布を潜在変数 $z$ について周辺化することで得られる。\[p(x | \theta) = \int p(x, z | \theta) dz\]学習において最大化すべき対数尤度は $\log p(x | \theta)$ となるが、ここで「対数の中に積分(あるいは和)がある」という数理的構造が大きな障壁となる。多くの実用的なモデルにおいて、この積分を解析的に実行することは不可能であり、単純な最尤推定の枠組みではパラメータの更新式を導出できないという積分の壁に直面する。
条件付き事後分布の推論における困難性
データ $x$ が観測された下での潜在変数の分布である事後分布 $p(z | x, \theta)$ を求めることは、推論における中心的な課題である。ベイズの定理によれば、この事後分布は以下のように記述される。\[p(z | x, \theta) = \frac{p(x, z | \theta)}{p(x | \theta)} = \frac{p(x, z | \theta)}{\int p(x, z | \theta) dz}\]しかし、分母に現れる周辺尤度が前述の通り計算困難であるため、厳密な事後分布を計算することも同様に困難となる。このため、潜在変数の真の役割を特定したり、データの隠れた特徴を抽出したりするためには、この事後分布をいかに近似するかという問題が極めて重要になる。
潜在変数モデルが要請される実用的背景と表現能力
潜在変数モデルが広く利用される理由は、現実世界のデータが持つ多峰性や非線形性を、低次元の「概念」や「要因」に集約して理解できる高い表現能力にある。例えば、高次元の画像データの背後に数次元の特徴量を想定したり、多様な購買行動の背後に少数の顧客セグメントを想定したりすることで、データの解釈性が飛躍的に向上する。また、潜在変数を介することで、データの欠損補完や異常検知、さらには新たなデータの生成といった、単純な回帰や分類を超えた高度な応用が可能となる。
まとめ
潜在変数モデルは、観測不能な変数を導入することでデータの複雑な生成原理を記述できる強力な枠組みであるが、その代償として周辺尤度や事後分布の計算不可能性という数理的課題を抱えている。この「積分の壁」を乗り越えるために開発されたのが、次章以降で扱うEMアルゴリズムや変分推論といった手法であり、これらこそが現代の機械学習における確率的アプローチの基盤を支えている。
Mathematics is the language with which God has written the universe.