パーセプトロンと多層ネットワーク

パーセプトロン(Perceptron)および多層ニューラルネットワーク(Multilayer Neural Network)は、線形判別から出発して非線形関数近似へと拡張される機械学習モデルであり、関数解析・最適化・確率論の観点から統一的に理解される枠組みである。パーセプトロンは線形分離問題に対する最初のオンライン学習アルゴリズムであり、多層ネットワークはその非線形拡張として任意の関数近似能力を持つ。

パーセプトロンの基本設定

二値分類データ

\[\{(\boldsymbol{x}_i, y_i)\}_{i=1}^n,\quad \boldsymbol{x}_i \in \mathbb{R}^d,\; y_i \in \{-1,+1\}\]

に対し、パーセプトロンは線形判別関数

\[f(\boldsymbol{x}) = \boldsymbol{w}^\top \boldsymbol{x} + b,\quad \boldsymbol{w} \in \mathbb{R}^d,\; b \in \mathbb{R}\]

の符号 $\hat{y} = \mathrm{sign}(f(\boldsymbol{x}))$ により分類を行う。バイアス $b$ を陽に扱う代わりに、$\tilde{\boldsymbol{x}} = (\boldsymbol{x}^\top, 1)^\top \in \mathbb{R}^{d+1}$、$\tilde{\boldsymbol{w}} = (\boldsymbol{w}^\top, b)^\top \in \mathbb{R}^{d+1}$ と拡張すれば$f(\boldsymbol{x}) = \tilde{\boldsymbol{w}}^\top \tilde{\boldsymbol{x}}$ と書ける。以降では簡単のためこの拡張表現を用い、$\boldsymbol{w}$ でバイアスを含む結合パラメータを表す。

パーセプトロンの学習則

パーセプトロンアルゴリズムは、誤分類点 $(\boldsymbol{x}_i, y_i)$(すなわち $y_i(\boldsymbol{w}^\top \boldsymbol{x}_i) \leq 0$)に対して重みベクトルを以下のように更新するオンライン学習アルゴリズムである:

\[\boldsymbol{w} \leftarrow \boldsymbol{w} + y_i \boldsymbol{x}_i\]

この更新は直観的には「誤分類された点の方向に $y_i\boldsymbol{x}_i$ だけ重みを修正し、判別超平面を誤分類点に近づける」操作として解釈できる。データセットを繰り返し走査し(エポック)、誤分類がなくなるまで更新を続ける。更新のたびに誤分類コスト $-y_i(\boldsymbol{w}^\top\boldsymbol{x}_i)$ は$-y_i((\boldsymbol{w} + y_i\boldsymbol{x}_i)^\top\boldsymbol{x}_i)+ \|\boldsymbol{x}_i\|^2$ という量が変化し、$\|\boldsymbol{x}_i\|^2$ 分の進歩が保証される(これが収束定理の核心)。

収束定理と幾何学的解釈

Novikoff の収束定理(1962):以下の条件を仮定する。

  1. データは線形分離可能:$\exists \boldsymbol{w}^* \in \mathbb{R}^d$($\|\boldsymbol{w}^*\| = 1$)と$\gamma > 0$ s.t. $y_i(\boldsymbol{w}^{*\top}\boldsymbol{x}_i) \geq \gamma$($\forall i$)
  2. データ半径が有界:$\|\boldsymbol{x}_i\| \leq R$($\forall i$)

このとき、パーセプトロンアルゴリズムの誤分類(更新)回数は

\[T \leq \left(\frac{R}{\gamma}\right)^2\]

で上界が与えられる。$\gamma$ は分類超平面 $\boldsymbol{w}^*$ とデータ点の最小マージン、$R$ はデータの原点からの最大距離であり、$R/\gamma$(マージンで正規化した半径)が小さいほど高速に収束する。

証明の骨格:更新回数 $T$ に対して以下の二つの不等式を導く。

  • 内積の増大:各更新で $\boldsymbol{w}^{*\top}\boldsymbol{w}^{(t+1)}= \boldsymbol{w}^{*\top}(\boldsymbol{w}^{(t)} + y_i\boldsymbol{x}_i)\geq \boldsymbol{w}^{*\top}\boldsymbol{w}^{(t)} + \gamma$より $\boldsymbol{w}^{*\top}\boldsymbol{w}^{(T)} \geq T\gamma$。
  • ノルムの増大の抑制:$\|\boldsymbol{w}^{(t+1)}\|^2= \|\boldsymbol{w}^{(t)} + y_i\boldsymbol{x}_i\|^2\leq \|\boldsymbol{w}^{(t)}\|^2 + 2y_i\boldsymbol{w}^{(t)\top}\boldsymbol{x}_i + R^2\leq \|\boldsymbol{w}^{(t)}\|^2 + R^2$(更新は誤分類点のみで行われるため $y_i\boldsymbol{w}^{(t)\top}\boldsymbol{x}_i \leq 0$)より $\|\boldsymbol{w}^{(T)}\|^2 \leq TR^2$。

Cauchy–Schwarz 不等式より$T\gamma \leq \boldsymbol{w}^{*\top}\boldsymbol{w}^{(T)}\leq \|\boldsymbol{w}^{(T)}\| \leq \sqrt{T}R$であるから $T \leq R^2/\gamma^2$。$\square$

幾何学的には、$\boldsymbol{w}^{*\top}\boldsymbol{w}^{(T)}$ が更新回数に比例して増大する一方で $\|\boldsymbol{w}^{(T)}\|$ は$\sqrt{T}$ にしか増大しないという非対称性が収束を保証する。

損失関数としての解釈

パーセプトロンの更新則は損失関数

\[\ell_{\mathrm{perceptron}}(y, f(\boldsymbol{x}))= \max(0, -yf(\boldsymbol{x}))\]

に対する確率的勾配降下法(SGD)として解釈できる。誤分類点($yf(\boldsymbol{x}) < 0$)で勾配 $-y\boldsymbol{x}$ が生じ、$\boldsymbol{w} \leftarrow \boldsymbol{w} + y\boldsymbol{x}$(学習率 $\eta=1$)の更新に対応する。正分類点($yf(\boldsymbol{x}) > 0$)では損失がゼロで勾配が生じない。

ヒンジ損失 $\ell_{\mathrm{hinge}}(y,f) = \max(0, 1 - yf)$ との比較では、パーセプトロン損失はマージン定数を $1$ ではなく $0$ とした特殊ケースであり、マージンの最大化を明示的には行わない点が本質的な違いである。SVM はヒンジ損失に $\ell_2$ 正則化 $\lambda\|\boldsymbol{w}\|^2$ を加えることで最大マージン解を達成する。

線形分離不可能な場合の限界とカーネル化

パーセプトロンは線形分離可能なデータにのみ有限回で収束し、線形分離不可能な場合は収束しない(アルゴリズムが無限に発散する)。この制限を超えるためにカーネルパーセプトロンが導入される。

パーセプトロンの双対形式を導く。重みの初期値を $\boldsymbol{w}^{(0)} = \boldsymbol{0}$ とすると、更新則より任意の時点での重みは

\[\boldsymbol{w} = \sum_{i=1}^n \alpha_i y_i \boldsymbol{x}_i\]

の形で表される($\alpha_i \in \mathbb{Z}_{\geq 0}$:点 $\boldsymbol{x}_i$ が更新に使われた累積回数)。判別関数は

\[f(\boldsymbol{x}) = \boldsymbol{w}^\top\boldsymbol{x}= \sum_{i=1}^n \alpha_i y_i \boldsymbol{x}_i^\top \boldsymbol{x}= \sum_{i=1}^n \alpha_i y_i k(\boldsymbol{x}_i, \boldsymbol{x})\]

となる($k(\boldsymbol{x}_i,\boldsymbol{x}) = \boldsymbol{x}_i^\top\boldsymbol{x}$ は線形カーネル)。カーネルパーセプトロンでは内積 $\boldsymbol{x}_i^\top\boldsymbol{x}$ を任意の正定値カーネル $k(\boldsymbol{x}_i,\boldsymbol{x})$(RBF・多項式等)に置き換え、誤分類時に $\alpha_i \leftarrow \alpha_i + 1$ と更新する。これにより高次元・非線形特徴空間での分類が、カーネル関数の評価のみで実現できる(カーネルトリック)。

多層ニューラルネットワークの構造

$L$ 層の多層ニューラルネットワーク(Multilayer Perceptron, MLP)は線形変換と非線形活性化関数の合成として以下のように定義される。第 $\ell$ 層($\ell = 1,\ldots,L$)の前活性化値(Pre-activation)$\boldsymbol{z}^{(\ell)} \in \mathbb{R}^{n_\ell}$ と活性化値(Post-activation)$\boldsymbol{a}^{(\ell)} \in \mathbb{R}^{n_\ell}$ を

\[\boldsymbol{z}^{(\ell)}= W^{(\ell)}\boldsymbol{a}^{(\ell-1)} + \boldsymbol{b}^{(\ell)},\qquad\boldsymbol{a}^{(\ell)}= \sigma^{(\ell)}(\boldsymbol{z}^{(\ell)})\]

と定義する($W^{(\ell)} \in \mathbb{R}^{n_\ell \times n_{\ell-1}}$:重み行列、$\boldsymbol{b}^{(\ell)} \in \mathbb{R}^{n_\ell}$:バイアス、$\sigma^{(\ell)}$:層ごとの活性化関数、$n_0 = d$:入力次元)。入力は $\boldsymbol{a}^{(0)} = \boldsymbol{x}$、出力は $\boldsymbol{a}^{(L)} = f_{\boldsymbol{\theta}}(\boldsymbol{x})$。全パラメータを $\boldsymbol{\theta} = \{W^{(\ell)}, \boldsymbol{b}^{(\ell)}\}_{\ell=1}^L$とすると、ネットワーク全体は

\[f_{\boldsymbol{\theta}}(\boldsymbol{x})= W^{(L)}\sigma^{(L-1)}(W^{(L-1)}\cdots\sigma^{(1)}(W^{(1)}\boldsymbol{x}+\boldsymbol{b}^{(1)})\cdots+\boldsymbol{b}^{(L-1)})+\boldsymbol{b}^{(L)}\]

という合成関数として表される。活性化関数 $\sigma^{(\ell)}$ がなければ(または線形のとき)、ネットワーク全体は単一の線形変換 $W^{(L)}\cdots W^{(1)}\boldsymbol{x}$ に退化し、非線形活性化が表現能力の源泉となる。

表現能力と普遍近似定理

普遍近似定理(Hornik, 1991;Cybenko, 1989):$\sigma: \mathbb{R} \to \mathbb{R}$ が有界・連続・かつ非定数のとき、任意のコンパクト集合 $\mathcal{K} \subset \mathbb{R}^d$、任意の連続関数 $f: \mathcal{K} \to \mathbb{R}$、および任意の $\varepsilon > 0$ に対して、十分に大きな幅 $N$ を持つ一隠れ層ネットワーク$g(\boldsymbol{x}) = \sum_{j=1}^N c_j\sigma(\boldsymbol{w}_j^\top\boldsymbol{x} + b_j)$が存在して $\sup_{\boldsymbol{x}\in\mathcal{K}}|f(\boldsymbol{x})-g(\boldsymbol{x})| < \varepsilon$ を満たす。

ReLU については Leshno et al.(1993)により、活性化関数が非多項式(測度ゼロの点を除いて多項式でない)であれば普遍近似が成立することが示された。普遍近似定理は「存在性」のみを保証し、必要なユニット数や学習の実行可能性は保証しない点に注意する。

深さの効率性:深層ネットワークは浅いネットワークと比較して指数的に少ないニューロン数で同等の関数を表現できる場合がある。ReLU ネットワークにおいて、深さ $L$・幅 $n$ のネットワークが表現できる線形領域(Linear Region)の最大数は $O((n/d)^{(L-1)d}n^d)$ であり(Montufar et al., 2014)、深さとともに指数的に増大する。これは「深さが表現能力に対して質的な貢献をする」ことの理論的根拠である。

パラメータ初期化

深層ネットワークの学習安定性は初期化に強く依存する。不適切な初期化は勾配消失・勾配爆発を引き起こす。

  • Xavier 初期化(Glorot–Bengio, 2010):$\sigma$ が tanh など対称な活性化関数のとき、各層の入出力の分散を揃えるために$W^{(\ell)}_{jk} \sim \mathcal{U}(-\sqrt{6/(n_{\ell-1}+n_\ell)},\,\sqrt{6/(n_{\ell-1}+n_\ell)})$または $\mathcal{N}(0, 2/(n_{\ell-1}+n_\ell))$ とする。前向き計算と後ろ向き計算の両方で分散が保持されるよう設計されている。
  • He 初期化(He et al., 2015):ReLU 活性化では約半数のユニットが不活性化されるため、$W^{(\ell)}_{jk} \sim \mathcal{N}(0, 2/n_{\ell-1})$ とする。$2/n_{\ell-1}$ のファクター $2$ が ReLU の半活性化を補正する。

最適化とバックプロパゲーション

多層ネットワークの学習は損失関数

\[\mathcal{L}(\boldsymbol{\theta})= \frac{1}{n}\sum_{i=1}^n \ell(y_i, f_{\boldsymbol{\theta}}(\boldsymbol{x}_i))\]

を最小化する問題であり、誤差逆伝播法(Backpropagation)により各パラメータの勾配を効率的に計算する。

誤差信号の定義:第 $\ell$ 層の誤差信号(Error Signal)$\boldsymbol{\delta}^{(\ell)} \in \mathbb{R}^{n_\ell}$ を

\[\boldsymbol{\delta}^{(\ell)}= \frac{\partial \mathcal{L}}{\partial \boldsymbol{z}^{(\ell)}}\]

と定義する。出力層($\ell = L$)では損失と出力活性化の合成微分として

\[\boldsymbol{\delta}^{(L)}= \frac{\partial \mathcal{L}}{\partial \boldsymbol{a}^{(L)}}\odot \sigma^{(L)}{}'(\boldsymbol{z}^{(L)})\]

が得られ($\odot$:要素積)、中間層では連鎖律(Chain Rule)により

\[\boldsymbol{\delta}^{(\ell)}= \left(W^{(\ell+1)\top}\boldsymbol{\delta}^{(\ell+1)}\right)\odot \sigma^{(\ell)}{}'(\boldsymbol{z}^{(\ell)})\]

という後ろ向き再帰式(Backward Recursion)が成立する。これを出力層から入力層に向けて順に計算することで全層の誤差信号が得られる。

勾配の計算:重み行列とバイアスの勾配は

\[\frac{\partial \mathcal{L}}{\partial W^{(\ell)}}= \frac{1}{n}\sum_{i=1}^n \boldsymbol{\delta}_i^{(\ell)} \boldsymbol{a}_i^{(\ell-1)\top},\qquad\frac{\partial \mathcal{L}}{\partial \boldsymbol{b}^{(\ell)}}= \frac{1}{n}\sum_{i=1}^n \boldsymbol{\delta}_i^{(\ell)}\]

と表される($\boldsymbol{\delta}_i^{(\ell)}$・$\boldsymbol{a}_i^{(\ell)}$:$i$ 番目の標本に対する誤差信号・活性化値)。バックプロパゲーション全体の計算量は前向き計算と同程度の$O(n\sum_\ell n_\ell n_{\ell-1})$ であり、素朴な有限差分法(パラメータ数 $|\boldsymbol{\theta}|$ 回の前向き計算)と比較して$O(|\boldsymbol{\theta}|)$ 倍効率的である。

勾配消失と勾配爆発

バックプロパゲーションにおける誤差信号の後ろ向き再帰式より、第 $1$ 層への勾配は

\[\boldsymbol{\delta}^{(1)}= \left(\prod_{\ell=2}^{L} W^{(\ell)\top}\mathrm{diag}(\sigma^{(\ell-1)}{}'(\boldsymbol{z}^{(\ell-1)}))\right)\boldsymbol{\delta}^{(L)}\]

という積の形で表される。この積のスペクトルノルムが指数的に小さいとき勾配消失(Vanishing Gradient)、指数的に大きいとき勾配爆発(Exploding Gradient)が生じる。シグモイドや tanh の飽和領域では $|\sigma'(z)| \approx 0$ となり勾配消失が深刻。対策として以下が用いられる:

  • ReLU 系活性化関数:活性領域($z > 0$)での勾配が $1$ に保たれ(飽和しない)、勾配消失が緩和される(ただし死んだニューロン問題が生じる場合がある)。
  • 残差接続(ResNet):後述。恒等写像の加算による勾配高速道路の形成。
  • 勾配クリッピング:勾配爆発への対策として $\|\nabla\mathcal{L}\| > \tau$ のとき$\nabla\mathcal{L} \leftarrow \tau\nabla\mathcal{L}/\|\nabla\mathcal{L}\|$ と正規化する。

確率的勾配降下法と変種

実際には全データの勾配(バッチ勾配降下)の代わりに、ミニバッチ $\mathcal{B}_t \subset \{1,\ldots,n\}$($|\mathcal{B}_t| = B$)を用いた確率的勾配降下法(SGD)

\[\boldsymbol{\theta}^{(t+1)}= \boldsymbol{\theta}^{(t)}- \eta_t \frac{1}{B}\sum_{i \in \mathcal{B}_t}\nabla_{\boldsymbol{\theta}} \ell(y_i, f_{\boldsymbol{\theta}^{(t)}}(\boldsymbol{x}_i))\]

が用いられる($\eta_t$:学習率)。確率的勾配は真の勾配の不偏推定量であり、凸問題では $O(1/\sqrt{T})$(凸)または $O(1/T)$(強凸)の収束速度が保証される。

適応的手法(Adam;Kingma–Ba, 2015):一次・二次モーメントの指数移動平均を用いた学習率の座標ごとの適応的調整:

\[m_t = \beta_1 m_{t-1} + (1-\beta_1)g_t,\quad v_t = \beta_2 v_{t-1} + (1-\beta_2)g_t^2,\quad\hat{\boldsymbol{\theta}} \leftarrow \boldsymbol{\theta} - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t}+\varepsilon}\]

($g_t = \nabla_{\boldsymbol{\theta}}\mathcal{L}$、$\hat{m}_t$・$\hat{v}_t$:バイアス補正済み推定量)。

非凸最適化の現状:深層ネットワークの損失関数は一般に非凸であり、多数の局所最小解(Local Minima)と鞍点(Saddle Points)が存在する。理論的には局所最適解への収束しか保証されないが、実用上は「十分な過剰パラメータ化」(Overparameterization)のもとで大域最適解に近い解が得られることが経験的・理論的に示されている(損失ランドスケープの良性構造;Goodfellow et al., 2015)。また幅が無限大の極限では損失は概凸になることが理論的に示されている(NTK 体制)。

正則化と汎化性能

多層ネットワークでは過学習を防ぐために以下の正則化手法が用いられる。

  • $\ell_2$ 正則化(Weight Decay):損失に $\lambda\|\boldsymbol{\theta}\|_2^2$ を加える。ガウス事前分布のもとでの MAP 推定に対応し(ベイズ解釈)、SGD の更新則では $\boldsymbol{w} \leftarrow (1-\eta\lambda)\boldsymbol{w} - \eta\nabla_{\boldsymbol{w}}\mathcal{L}$という重みの減衰(Decay)として現れる。
  • ドロップアウト(Dropout;Srivastava et al., 2014):訓練時に各ニューロンを確率 $p$(ドロップ率、典型的に $0.5$)で独立にゼロに設定する確率的正則化。$2^N$ 個の異なるサブネットワーク($N$:ニューロン数)のアンサンブルとして解釈でき、推論時には全ニューロンを使用し重みを $1-p$ 倍してスケールを補正する。
  • バッチ正規化(Batch Normalization;Ioffe–Szegedy, 2015):各ミニバッチで前活性化値を正規化し、学習可能なスケール $\gamma$・シフト $\delta$ で再スケール:$\hat{z}_j = (z_j - \hat{\mu}_B)/\sqrt{\hat{\sigma}_B^2+\varepsilon}$、$\tilde{z}_j = \gamma_j\hat{z}_j + \delta_j$。内部共変量シフトを抑制し、大きな学習率でも安定した学習を可能にする。
  • 早期停止(Early Stopping):検証データの損失が増加し始めた時点で学習を打ち切る。$\ell_2$ 正則化と等価な効果を持つことが知られている(凸問題の場合)。

残差接続と深層アーキテクチャ

残差ネットワーク(ResNet;He et al., 2016)は各ブロックに恒等写像(ショートカット接続)を加える:

\[\boldsymbol{a}^{(\ell+1)}= \sigma\!\left(F(\boldsymbol{a}^{(\ell)}; W^{(\ell)})\right) + \boldsymbol{a}^{(\ell)}\]

ここで $F(\boldsymbol{a}^{(\ell)};W^{(\ell)})$ は残差写像(Residual Mapping)。残差接続により逆伝播の勾配が$\frac{\partial \boldsymbol{a}^{(L)}}{\partial \boldsymbol{a}^{(1)}}= \prod_\ell (I + \frac{\partial F_\ell}{\partial \boldsymbol{a}^{(\ell)}})$という積の形になり、恒等行列 $I$ の加算が勾配消失を回避する「勾配高速道路」(Gradient Highway)を提供する。100 層以上の超深層ネットワークの安定学習を実現し、ImageNet 等での精度を大幅に改善した。

関数空間と RKHS・NTK との関係

無限幅極限($n_\ell \to \infty$)において、ニューラルネットワークはガウス過程に収束することが示されている(Neal, 1996;Lee et al., 2018)。具体的には、パラメータを i.i.d. 正規分布で初期化した一隠れ層ネットワーク$f(\boldsymbol{x}) = \frac{1}{\sqrt{N}}\sum_{j=1}^N w_j^{(2)}\sigma(\boldsymbol{w}_j^{(1)\top}\boldsymbol{x} + b_j)$は $N \to \infty$ のとき関数 $f$ の有限次元周辺分布が多変量正規分布に収束し、$f \sim \mathcal{GP}(0, k_{\mathrm{NN}})$ となる($k_{\mathrm{NN}}$:アーキテクチャが定める NNGP カーネル)。

ニューラルタンジェントカーネル(NTK;Jacot et al., 2018):無限幅ネットワークの勾配降下による学習を記述するカーネルとして

\[\Theta(\boldsymbol{x}, \boldsymbol{x}')= \left\langle\nabla_{\boldsymbol{\theta}} f_{\boldsymbol{\theta}}(\boldsymbol{x}),\,\nabla_{\boldsymbol{\theta}} f_{\boldsymbol{\theta}}(\boldsymbol{x}')\right\rangle_{\boldsymbol{\theta}}\]

が定義される。無限幅極限では訓練中に $\Theta$ が初期値に固定(定数カーネル)され、勾配流(Gradient Flow)による訓練が線形化ネットワークのカーネルリッジ回帰(正則化なし)と等価になる。NTK 体制は有限幅ネットワークの動態の近似として理解され、「カーネル法としての深層学習」という統一的視点を与える。ただし NTK 体制は実際の有限幅ネットワークの「特徴学習」を捉えないため、実用的なネットワークの理解には限界がある。

幾何学的および情報論的視点

深層ネットワークは入力空間を層ごとに段階的に非線形変換し、最終的に線形分離可能な表現(特徴空間)へと写像する。この変換は幾何学的には以下の操作の合成として理解できる:

  • 折り畳み(Folding)と引き伸ばし(Stretching):ReLU による区分線形写像が入力空間を折り畳み・引き伸ばし、クラス間の決定境界を線形化する。
  • 次元変換:各層は次元 $n_{\ell-1}$ から $n_\ell$ への写像を行い、中間層での高次元表現(Bottleneck 構造も可能)が特徴の抽象化を実現する。

情報論的には Tishby–Schwartz–Bialek(2000)による情報ボトルネック(Information Bottleneck)理論が深層学習の解釈を試みており、各層が入力 $X$ の情報を保持しつつ目標 $Y$ に関連する情報のみを圧縮・抽出する過程として訓練を理解する(ただし理論の適用範囲については議論が続いている)。

まとめ

パーセプトロンは線形分類の基本モデルとして幾何学的に理解され、Novikoff の収束定理により線形分離可能なデータに対して有限回の更新で収束することが保証される。双対形式とカーネルトリックの組み合わせにより非線形分類へと自然に拡張できる。多層ニューラルネットワークは非線形活性化関数を持つ線形変換の合成として定義され、普遍近似定理により十分な幅を持つ一隠れ層ネットワークが任意の連続関数を近似できることが保証される。深さはさらに指数的な表現能力の向上をもたらし、バックプロパゲーションにより効率的な勾配計算が実現される。勾配消失・爆発の問題に対しては ReLU 系活性化関数・He 初期化・残差接続・バッチ正規化が有効であり、過学習への対策としてドロップアウト・Weight Decay・早期停止が用いられる。無限幅極限ではガウス過程・NTK との理論的等価性が成立し、有限幅の学習動態を線形化近似として記述するとともに、カーネル法と深層学習を統一する枠組みを与えている。

Mathematics is the language with which God has written the universe.





















数理統計学 機械学習