講演資料
講義資料スライドの表紙です。スライド画像、または下の要約文中の青いページ番号リンクをクリックすると、別のタブで無駄なノイズのない、純粋なPDFビューア画面が起動し、指定されたページへ直接ジャンプして快適に閲覧できます。
全体概要
本セミナー「初めてディープラーニング学ぶ人のための数学入門 ―― ニューラルネットで行列を理解する」は、ディープラーニングの数理的基盤を「行列」という概念を軸に据えながら、生物のニューラルネットワークから現代のConvolutional Neural Network(CNN)へと至る知的系譜を丁寧に追うものです。
中心的な「問い」は、「なぜニューラルネットワークの理解に行列が不可欠なのか」という一点に収束します。セミナーはまず、生物進化における神経系の起源と視覚の誕生という壮大な生物学的背景から出発し、Hubel & Wieselの大脳視覚野研究がニューラルネットワーク研究の源流となった歴史的経緯を紹介します [p.11], [p.12]。そのうえで、一個のニューロンの発火メカニズムを「賛成票・反対票の多数決」という直感的なモデルで説明し、重み(Weight)・バイアス(Bias)・活性化関数という概念を段階的に導入します [p.20], [p.22], [p.26]。
この議論の核心は、複数ニューロンからなる層全体の出力が、常に `φ(W·X + b)` という一つの式で表現できるという事実の発見にあります [p.42], [p.62]。スカラーの一次関数 `y = ax + b` と同じ形式を持つこの式が、ベクトルの内積、そして行列とベクトルの積へと拡張されることで、数百・数千のニューロンからなる複雑なネットワーク全体を一つの式に圧縮して記述できることが示されます [p.51], [p.52]。
後半のPart IIでは、Full Connectなネットワークが抱えるパラメーター爆発と局所特徴抽出の困難という二つの本質的問題を明確化し [p.142]、CNNがどのように「接続の局所化」「パラメーターの共有」「三次元ボリューム間の変換」という三つの革新でその問題を克服したかを解説します [p.153], [p.165]。本セミナーは、行列という道具が単なる計算手段ではなく、ニューラルネットワークの構造そのものを映し出す鏡であることを、最後まで丁寧に示し続けます。
講義のロードマップ
■ Part I: Deep Neural Network
- この部の核心:
一個のニューロンの発火条件という極めて具体的な出発点から、重み・バイアス・活性化関数を導入し、最終的に複数ニューロンからなる層全体の出力が `φ(W·X + b)` という統一的な行列式で記述されることを示します。この式がスカラー・ベクトル・行列のいずれの場合にも同一の形式を持つことが、TensorFlowをはじめとするフレームワークにおける「グラフ」「テンソル」「モジュール」という設計思想の数理的基盤となっています。
- 論理展開:
- カンブリア紀の「視覚の誕生」、Hubel & Wieselの大脳視覚野研究がニューラルネット研究の歴史的起源であることを確認します [p.7], [p.11], [p.12]。
- ニューロンの発火条件を `A – B > C`(興奮性シナプスと抑制性シナプスの差が閾値を超えること)として定式化し、これを `W·X + b > 0` の形へと等価変換することで、「重み」と「バイアス」の概念を導入します [p.22], [p.26], [p.27]。
- 一個のニューロンの出力 `φ(W·X + b)` が、複数ニューロンからなる層全体にも同じ式の形(ただしWが行列、bがベクトル)で表せることを行列演算で示します [p.40], [p.41], [p.46]。
- `Y = W·X + b` が、Wがスカラー・ベクトル・行列のいずれであっても同一の形式で多様な関係式を表現できる「式の便利さ」を具体例で確認します [p.49], [p.50], [p.51]。
- sigmoid、ReLU、tanhなど主要な活性化関数を紹介し、ニューロンの出力が `φ(W·X + b)` で統一的に表現されることを確認します [p.56], [p.57], [p.58]。
- TensorFlowのグラフ表現(演算ノード・変数ノード・プレースホルダー)を導入し、Full ConnectなDNNが「積→和→活性化」という同一モジュールの反復として記述されることを示します [p.65], [p.67], [p.77]。
- グラフを流れるデータが「テンソル」として統一的に扱われること、テンソルのランクとシェイプの概念を整理します [p.101], [p.102], [p.104], [p.105]。
- TensorFlow・CNTK・Torch7といった異なるフレームワークのグラフ表現が、本質的に同一のネットワーク構造を表していることを対比して確認します [p.90], [p.91], [p.92]。
■ Part II: Convolutional Neural Network
- この部の核心:
Full Connectなネットワークが抱える「パラメーター数の爆発」と「画像データの局所的特徴の抽出困難」という二つの本質的問題を明確化し、CNNが「接続の局所化」「パラメーターの共有」「三次元ボリューム間の変換」という革新によってそれを克服する仕組みを解説します。特に、Full Connectな入力層が実は「順序を持たない集合」として機能しているという洞察は、CNNの設計思想の根拠を鮮明にします。
- 論理展開:
- Full Connectなネットワークでは入力層のノードの並び順に意味がなく、ノードの集合は「構造を持たない集合」であることを、入力ベクトルの置き換え不変性として示します [p.110], [p.111], [p.112], [p.128]。
- パラメーター数の爆発問題を、MNIST・CIFAR-10・ImageNetなどの実際の画像データの画素数を参照しながら定量的に示します [p.143], [p.144], [p.145]。
- 「接続の局所化(局所的受容野)」と「パラメーターの共有」という二つの革新により、Full Connect時の42個のパラメーターがCNN化で4個まで削減される具体例を示します [p.157], [p.163], [p.165]。
- CNNの各層が「三次元ボリューム(幅×高さ×深さ)から三次元ボリュームへの変換」として機能することを示し、5×5×3のフィルターが画像上をスライドしてActivation Mapを生成する仕組み(Convolution層)を解説します [p.173], [p.174], [p.180], [p.183], [p.185]。
- Pooling層(Max Pooling)が、パラメーターを持たずにデータを空間方向に縮小し、微細なシフトや欠損を捨象する役割を担うことを示します [p.189], [p.190]。
- Hubel & Wieselの「受容野」概念とCNNの局所的受容野の設計が直接的に対応していることを確認し、ConvNetの高位ユニットの活性化がサルの下側頭皮質のニューロンの変異の半分を説明するという実験結果に言及します [p.170], [p.172]。
