エンコーダ・デコーダ構造

トランスフォーマーの全体アーキテクチャは、入力系列を高次の潜在表現へ写像するエンコーダと、その表現に条件づけられて出力系列を逐次生成するデコーダから構成される。この構造は、条件付き確率分布 $p_{\theta}(y|x)$ を直接モデル化する枠組みであり、従来の系列モデルにおける再帰的依存を排除しつつ、全域的な依存関係を明示的に扱う点に本質的特徴がある。Self-Attention による全結合的な相互作用と、クロスアテンションによる入力・出力間の結合は、系列変換問題における最適な表現学習の一形態とみなすことができる。

基本設定

入力系列 $x = (x_1, \dots, x_n)$ と出力系列 $y = (y_1, \dots, y_m)$ を考える。トランスフォーマーは、これらの系列をそれぞれ埋め込み空間 $\mathbb{R}^{d_{model}}$ に写像した後、エンコーダおよびデコーダの層を通じて変換を行う。最終的な目標は、以下の自己回帰分解に基づく尤度の最大化である。

\[\log p_{\theta}(y|x) = \sum_{t=1}^{m} \log p_{\theta}(y_t \mid y_{\lt t}, x)\]

ここで $y_{\lt t} = (y_1, \dots, y_{t-1})$ は過去の出力である。この分解により、デコーダは逐次的な条件付き生成モデルとして機能する。一方で、各ステップの内部計算は並列化可能であるため、従来のRNNと比較して計算効率が飛躍的に向上する。

エンコーダの内部構造と数理

エンコーダは $N$ 層の同一構造のスタックであり、各層は以下の2つのサブレイヤーから構成される。

  • Multi-Head Self-Attention
  • Position-wise Feed-Forward Network(FFN)

入力を $H^{(l-1)}$、出力を $H^{(l)}$ とすると、各層は次のように記述される(Post-Norm の場合)。

\[\tilde{H}^{(l)} = \mathrm{LayerNorm}\left(H^{(l-1)} + \mathrm{MHA}(H^{(l-1)})\right)\]\[H^{(l)} = \mathrm{LayerNorm}\left(\tilde{H}^{(l)} + \mathrm{FFN}(\tilde{H}^{(l)})\right)\]

Self-Attention は、入力系列内のすべての位置間の相互作用を $O(n^2)$ の計算で同時に評価する。これにより、長距離依存関係が直接的にモデル化される。FFN は各位置に独立に作用する非線形写像であり、次のように定義される。

\[\mathrm{FFN}(x) = \sigma(xW_1 + b_1)W_2 + b_2\]

ここで $\sigma$ は ReLU や GELU などの活性化関数である。$W_1 \in \mathbb{R}^{d_{model} \times d_{ff}}$、$W_2 \in \mathbb{R}^{d_{ff} \times d_{model}}$ により、特徴空間の拡張と圧縮が行われる。この構造は、局所的な非線形変換とグローバルな情報統合を分離するという観点から重要である。

残差接続と正規化の理論的意義

各サブレイヤーに適用される残差接続は、関数空間における恒等写像の近傍での学習を可能にし、深層化に伴う勾配消失問題を緩和する。すなわち、層は $f(x)$ を直接学習するのではなく、$x + f(x)$ という摂動として学習する。

Layer Normalization は、各トークンごとに特徴次元方向の平均と分散を正規化する操作であり、次のように定義される。

\[\mathrm{LayerNorm}(x) = \frac{x - \mu(x)}{\sqrt{\sigma^2(x) + \epsilon}} \gamma + \beta\]

ここで $\mu(x)$ と $\sigma^2(x)$ はそれぞれ平均と分散であり、$\gamma, \beta$ は学習可能パラメータである。この操作は、内部共変量シフトの抑制および勾配の安定化に寄与する。

デコーダの内部構造とクロスアテンション

デコーダは各層において3つのサブレイヤーを持つ。

  • Masked Multi-Head Self-Attention
  • Encoder-Decoder Attention(クロスアテンション)
  • FFN

特に重要なのはクロスアテンションであり、これは入力系列と出力系列の結合を担う。クエリはデコーダの内部状態から、キーとバリューはエンコーダ出力 $Z$ から与えられる。

\[\mathrm{Attention}(Q_{dec}, K_{enc}, V_{enc}) = \mathrm{softmax}\left(\frac{Q_{dec}K_{enc}^T}{\sqrt{d_k}}\right)V_{enc}\]

この操作は、出力系列の各位置において、入力系列のどの部分が重要であるかを動的に決定する。すなわち、条件付き分布 $p(y_t | y_{

マスキングと自己回帰性

デコーダの Self-Attention では、未来の情報を遮断するためにマスク行列 $M$ が導入される。スコア行列に対して次のように適用される。

\[\mathrm{softmax}\left(\frac{QK^T}{\sqrt{d_k}} + M\right)\]

ここで、$M_{ij} = -\infty$($j > i$ の場合)とすることで、未来トークンへの注意が完全に遮断される。この制約により、モデルは因果的(causal)な生成過程を満たす。

位置エンコーディングの数理的構造

位置エンコーディングは、系列の順序情報をベクトル空間に埋め込むための機構である。代表的な正弦波ベースの定義は以下の通りである。

\[PE_{(pos, 2i)} = \sin\left(\frac{pos}{10000^{2i/d_{model}}}\right)\]\[PE_{(pos, 2i+1)} = \cos\left(\frac{pos}{10000^{2i/d_{model}}}\right)\]

この設計により、任意の位置差 $k$ に対して、$PE(pos+k)$ が $PE(pos)$ の線形結合として表現可能となる。この性質は、モデルが相対位置関係を線形演算で扱えることを意味し、汎化性能の向上に寄与する。

情報流と表現の幾何学的解釈

エンコーダは入力系列を高次元多様体上の点列として再配置し、Self-Attention によりその幾何構造を再構成する。一方でデコーダは、この多様体上の情報を条件として逐次的に射影し、新たな系列を生成する。クロスアテンションは、二つの多様体間の写像(対応付け)として理解できる。

この観点から、トランスフォーマーは単なるニューラルネットワークではなく、「確率分布の条件付き変換を実現する関数空間上の作用素」として位置づけられる。

まとめ

エンコーダ・デコーダ構造は、Self-Attention による全域的依存関係の抽出と、クロスアテンションによる条件付き生成を統合した数理的枠組みである。残差接続、正規化、位置エンコーディングといった各要素は、深層学習における最適化理論と密接に結びついており、その統合によって高い表現力と安定性が実現されている。この構造は、自然言語処理にとどまらず、画像・音声・マルチモーダルデータに対する普遍的な生成モデルの基盤となっている。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習