期待値の定義と性質

期待値は確率変数の平均的な値を表す量であり、確率分布に関する最も基本的な統計量である。その本質は測度論に基づく積分概念にあり、確率測度に関するルベーグ積分として統一的に定義される。この定式化により、離散型・連続型の別を問わず一貫した理論が構築される。

定義(測度論的定式化)

確率空間 $(\Omega, \mathcal{F}, P)$ 上の可測関数(確率変数) $X:\Omega \to \mathbb{R}$ に対して、期待値は

\[ \mathbb{E}[X] = \int_{\Omega} X(\omega)\, dP(\omega) \]

によって定義される。ただしこの定義は、$X$ が可積分、すなわち

\[ \int_{\Omega} |X|\,dP < \infty \]

を満たす場合に限って有限値として定義される。一般には $X$ を正負部分に分解し、

\[ X = X^+ - X^-, \quad X^+ = \max(X,0), \; X^- = \max(-X,0) \]

として

\[ \mathbb{E}[X] = \int X^+ dP - \int X^- dP \]

と定義される(少なくとも一方が有限である場合)。

分布(像測度)による表現

確率変数 $X$ が誘導する像測度 $\mu_X = P \circ X^{-1}$ を用いると、期待値は

\[ \mathbb{E}[X] = \int_{\mathbb{R}} x \, d\mu_X(x) \]

と書ける。これは期待値が確率変数そのものではなく、その分布のみに依存することを示す重要な表現である。

分布関数による表現

$X \ge 0$ のとき、分布関数を用いて

\[ \mathbb{E}[X] = \int_0^\infty P(X > t)\, dt \]

と表される(層別積分表示)。これは尾確率との関係を明確にする。

離散型の場合

確率質量関数 $p(x) = P(X=x)$ を用いると、

\[ \mathbb{E}[X] = \sum_{x} x\,p(x) \]

となる。

連続型の場合

確率密度関数 $f(x)$ を用いると、

\[ \mathbb{E}[X] = \int_{-\infty}^{\infty} x f(x)\,dx \]

である。

関数の期待値(LOTUS)

可測関数 $g$ に対して、

\[ \mathbb{E}[g(X)] = \int_{\mathbb{R}} g(x)\, d\mu_X(x) \]

が成立する。離散型・連続型ではそれぞれ

\[ \mathbb{E}[g(X)] = \begin{cases} \sum_x g(x)p(x) \\ \int g(x)f(x)\,dx \end{cases} \]

と表される。これはLOTUS(無意識の統計学者の法則)と呼ばれる。

LOTUS(Law of the Unconscious Statistician)とは、「確率変数の分布さえ分かっていれば、その関数の期待値は“無意識的に”計算できる」という原理を指す非公式な名称である。本質は、確率変数の関数の期待値を、元の確率変数の分布を用いて直接計算できるという点にある。

例えば、$X \sim \mathrm{Uniform}(0,1)$ のとき、\[\mathbb{E}[X^2]\]を求めることを考える。通常は $Y = X^2$ の分布を求めることを考えるが、LOTUS を用いれば、\[\mathbb{E}[X^2] = \int_0^1 x^2 \, dx = \frac{1}{3}\]と直接計算できる。

LOTUS は単なる計算テクニックではない。可測空間 $(\Omega, \mathcal{F})$ と $(\mathbb{R}, \mathcal{B}(\mathbb{R}))$ の間の可測写像\[X : \Omega \to \mathbb{R}\]を考える。このとき、確率測度 $P$ から $\mathbb{R}$ 上の測度への押し出し(pushforward measure;押し出しとは写像によって元の空間上の測度を別の空間へ移す操作)を\[\mu_X = P \circ X^{-1}\]によって定義する。すなわち任意のボレル集合 $B \in \mathcal{B}(\mathbb{R})$ に対して、\[\mu_X(B) = P(X \in B)\]このとき。可測関数 $g : \mathbb{R} \to \mathbb{R}$ に対して、次の積分変換公式が成立する。\[\int_{\Omega} g(X(\omega)) \, dP(\omega)=\int_{\mathbb{R}} g(x) \, d(P \circ X^{-1})(x)\]したがって、\[\mathbb{E}[g(X)] = \int_{\mathbb{R}} g(x) \, d\mu_X(x)\]これは、写像 $X$ によって測度 $P$ を押し出した結果として得られる分布 $\mu_X$ に関する積分に、元の確率空間上の積分が一致することを意味する。すなわちLOTUSとは、ルベーグ積分における「変数変換」の最も一般的な形に他ならない。

基本性質

線形性

\[ \mathbb{E}[aX + bY] = a\mathbb{E}[X] + b\mathbb{E}[Y] \]

単調性

\[ X \le Y \;\text{a.s.} \;\Rightarrow\; \mathbb{E}[X] \le \mathbb{E}[Y] \]

非負性

\[ X \ge 0 \Rightarrow \mathbb{E}[X] \ge 0 \]

定数

\[ \mathbb{E}[c] = c \]

絶対値との関係

\[ |\mathbb{E}[X]| \le \mathbb{E}[|X|] \]

独立性と積

独立な確率変数に対して、

\[ \mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y] \]

条件付き期待値

部分 $\sigma$-代数 $\mathcal{G} \subset \mathcal{F}$ に対して、条件付き期待値 $\mathbb{E}[X|\mathcal{G}]$ は

\[ \int_G \mathbb{E}[X|\mathcal{G}]\, dP = \int_G X\, dP \quad (\forall G \in \mathcal{G}) \]

を満たす $\mathcal{G}$-可測関数として定義される。

塔の法則

\[ \mathbb{E}[\mathbb{E}[X|\mathcal{G}]] = \mathbb{E}[X] \]

分散との関係

分散は期待値によって

\[ \mathrm{Var}(X) = \mathbb{E}[(X-\mathbb{E}[X])^2] = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 \]

と定義される。

不等式

ヤンセンの不等式

\[ \varphi(\mathbb{E}[X]) \le \mathbb{E}[\varphi(X)] \]

凸関数に対しては、「平均をとってから変換する」よりも「変換してから平均をとる」方が大きくなることを示す不等式である。分布のばらつきが大きいほど差が開くという直感を形式化したものでもある。確率論だけでなく、情報理論や最適化においても基本的な役割を果たす。

マルコフの不等式

\[ P(X \ge a) \le \frac{\mathbb{E}[X]}{a} \]

非負確率変数に対して、「大きな値をとる確率」は期待値によって上から抑えられることを示す最も基本的な評価である。分布の詳細を知らなくても使える点が重要である。多くの確率不等式の出発点となる。

チェビシェフの不等式

\[ P(|X-\mu| \ge \varepsilon) \le \frac{\mathrm{Var}(X)}{\varepsilon^2} \]

平均からのずれが大きくなる確率は分散によって制御されることを示す不等式である。ばらつき(分散)が小さいほど、値が平均付近に集中することを意味する。大数の法則の証明にも用いられる基本的な道具である。

ヘルダー不等式

$1 \le p, q \le \infty,\quad \frac{1}{p} + \frac{1}{q} = 1$ のとき、\[\mathbb{E}[|XY|]\le\left(\mathbb{E}[|X|^p]\right)^{1/p}\left(\mathbb{E}[|Y|^q]\right)^{1/q}\]

ヘルダー不等式は「積」を評価する不等式であり、$L^p$ 空間における双対性($p$ と $q$ の関係)を表現する。

ミンコフスキー不等式

$1 \le p < \infty$ のとき、\[\left(\mathbb{E}[|X+Y|^p]\right)^{1/p} \le \left(\mathbb{E}[|X|^p]\right)^{1/p}+\left(\mathbb{E}[|Y|^p]\right)^{1/p}\]

ミンコフスキー不等式は三角不等式に対応し、$L^p$ 空間がノルム空間であることを保証する。これらにより期待値は解析学的な構造(距離・ノルム)と結びつく。

なお、ミンコフスキー不等式はヘルダー不等式を用いて証明される。また、ヘルダー不等式とミンコフスキー不等式は、$L^p$ 空間の解析構造を支える二本柱であるため、しばしば、ヘルダー・ミンコフスキー不等式と並べて呼ばれる。

収束定理

単調収束定理

\[ X_n \uparrow X \Rightarrow \lim \mathbb{E}[X_n] = \mathbb{E}[X] \]

優収束定理

\[ X_n \to X,\; |X_n|\le Y,\; \mathbb{E}[Y]<\infty \Rightarrow \mathbb{E}[X_n]\to \mathbb{E}[X] \]

ファトゥの補題

\[ \mathbb{E}[\liminf X_n] \le \liminf \mathbb{E}[X_n] \]

大数の法則との関係

期待値は確率論の極限定理と密接に関係し、独立同分布列に対して標本平均が期待値に収束する(弱・強大数の法則)。これは期待値が「長期平均」と一致することを保証する。

まとめ

期待値は単なる平均値の一般化ではなく、確率測度に関するルベーグ積分として定式化されることで、離散・連続を統一し、極限操作・条件付き構造・不等式体系と結びついた強力な概念である。その理論的基盤は測度論に支えられており、確率論・統計学・機械学習のあらゆる分野において中心的役割を果たす。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習