講演資料


講義資料スライドの表紙

講義資料スライドの表紙です。スライド画像、または下の要約文中の青いページ番号リンクをクリックすると、別のタブで無駄なノイズのない、純粋なPDFビューア画面が起動し、指定されたページへ直接ジャンプして快適に閲覧できます。

全体概要

本セミナー「マトリョーシカとトロピカル」は、2024年初頭に起きた二つのAI技術上の重要な動向——OpenAIの新しいembeddingモデルの基盤技術である「Matryoshka Representation Learning(MRL)」と、大規模言語モデルの計算コストを根本から変革しようとする「1-bit LLM(BitNet b1.58)」——を取り上げ、これらを「AIのダウンサイジング」という統一的な視点のもとで解読する試みです [p.1], [p.9]

現代のAIシステムは、巨大なモデルサイズと膨大なエネルギー消費を前提として成立しています。しかし本セミナーは、その前提が歴史的に変わりうるという見通しを提示します。1945年に部屋一杯を占めたENIACが、数十年後には手のひらサイズのデバイスに収まった歴史的経緯と同様に、現在のGPU依存・大規模クラウド前提のAIシステムもいつかダウンサイジングされうる——そのような長期的視点が、本セミナー全体を貫く問題意識です [p.38], [p.39], [p.35]

MRLは、一度大きな次元で学習したembeddingを、目的に応じて柔軟に次元を変えて利用できる技術です。マトリョーシカ人形の「入れ子」構造に例えられるように、高次元embeddingの内部に低次元embeddingが包含される形で学習されるため、スマートフォンのような非力なデバイス上でも高品質な推論が可能になります。OpenAIのtext-embedding-3はこの技術を採用しており、MRLこそが現代のembedding技術の最前線に位置します [p.13], [p.14], [p.19]

一方、BitNet b1.58は、ニューラルネットワークの「重み行列」の各要素を{-1, 0, +1}の三値で表現することで、行列乗算における掛け算演算をほぼ不要にし、整数の加算のみで推論を完結させる革新的アーキテクチャです。これにより、LLaMAと同等の性能を保ちながら、エネルギー消費を最大71.4倍削減し、メモリフットプリントを大幅に圧縮します [p.24], [p.26]

さらにセミナーは「トロピカル代数」という数学的視点を提示します。トロピカル代数は掛け算を足し算に、足し算をmin/max演算に置き換える体系であり、ディープニューラルネットワークとの深い等価関係が近年発見されています。これらのAIダウンサイジングの動きが、トロピカル代数という数学的基礎の上でさらに加速するという展望が、セミナーの名称「マトリョーシカとトロピカル」の本質的な意味です [p.29], [p.31], [p.33]


講義のロードマップ


■ Part 1: AI技術の最近の動向について

  • この部の核心:

MRLと1-bit LLMという二つの技術潮流を「AIのダウンサイジングの始まり」として位置づけます。巨大システムへの依存を前提としてきたAI開発の構造的変化が始まっていることを示し、それを数学的に支えうる「トロピカル代数」の存在を予告します [p.9], [p.10]

  • 論理展開:
  • 「マトリョーシカ」はembeddingの次元を柔軟に変えられる技術であり、OpenAIのtext-embedding-3の基盤として採用された [p.13], [p.19], [p.20]
  • 1-bit LLMは、重み行列を二値・三値化することで掛け算を加算のみに置き換え、エネルギーコストを桁違いに削減する [p.22], [p.23]
  • トロピカル代数は「掛け算→足し算、足し算→min/max」という変換体系であり、ReLU活性化関数を持つニューラルネットワークとの等価関係が2018年に証明された [p.29], [p.33]
  • ENIAC(1945年)から1956年の5MBハードディスク、現在のNVIDIA DGX SuperPODへの変遷と比較し、現在のAIもダウンサイジングされる歴史的必然を論じる [p.38], [p.39], [p.40]


■ Part 2: embedding技術の新しい展開

  • この部の核心:

MRL論文("Matryoshka Representation Learning")を精読し、入れ子型embeddingの学習原理、適応的分類(Adaptive Classification)、大規模ベクトル検索(Vector Search)、適応的検索(Adaptive Retrieval)の実装と性能を詳解します。OpenAIのtext-embedding-3との接続も確認します [p.44], [p.46]

  • 論理展開:
  • MRLは、O(log(d))個の次元を入れ子式に最適化することで、一回の学習で複数次元に対応したembeddingを生成する。独立に学習した低次元モデルと同等以上の精度を持つ [p.56], [p.58]
  • Adaptive Classificationでは、ImageNet-1Kにおいて平均36次元のembeddingでFF-512と同等精度(76.3%)を達成——14倍のサイズ削減 [p.73], [p.74]
  • Vector Searchの文脈では、FAISSとHNSW(Hierarchical Navigable Small World)を組み合わせた近似最近傍探索により、大規模データベースへの効率的なembedding検索を実現する [p.108], [p.111], [p.115]
  • Adaptive Retrievalでは、低次元(Ds=16)でショートリスト200件を取得し、高次元(Dr=2048)で再ランキングする二段階戦略により、理論値128倍・実測値14倍の高速化を達成 [p.102], [p.104], [p.105]


■ Part 3: 大規模言語モデルのアーキテクチャーの見直し

  • この部の核心:

BitNet b1.58("The Era of 1-bit LLMs")とその前身BitNetを精読し、1-bit Transformerの設計原理、BitLinearによる量子化・脱量子化の仕組み、LLaMAとの性能・効率比較を具体的に解説します。三値{-1,0,+1}への重み行列の量子化が、なぜ「1.58bit」と呼ばれるかも明らかにします [p.123], [p.126]

  • 論理展開:
  • 三値{-1,0,+1}を表現するのに必要なビット数はlog₂3≒1.58bitであり、これが論文タイトル「1.58 Bits」の由来である [p.128], [p.129]
  • BitNet b1.58は、3BサイズでLLaMA相当の性能(パープレキシティ・ゼロショット精度)を達成しながら、メモリ3.55倍削減・レイテンシ2.71倍高速・エネルギー消費71.4倍削減を実現 [p.26], [p.144], [p.146]
  • BitNetの実装は、LLaMa2のTransformerアーキテクチャにおけるnn.Linear関数をBitLinearで置き換えるだけで実現される。Multi-Head AttentionとFeed Forward Networkの両方で置き換えが行われる [p.160], [p.171], [p.173], [p.177]
  • BitLinearの処理は「LayerNorm→Absmax量子化→1-bit重み行列との積→脱量子化」の四段階。重み行列の量子化はSign関数と全要素平均αを用いた単純な閾値処理で実現される [p.187], [p.190], [p.193], [p.195]

▶️ 講演動画

講義 - 1
講義 - 2
講義 - 3

💡 エピソード動画

エピソード - 1
エピソード - 2
エピソード - 3
エピソード - 4
エピソード - 5
エピソード - 6
エピソード - 7
エピソード - 8
エピソード - 9
エピソード - 10
エピソード - 11
エピソード - 12
エピソード - 13