講演資料
講義資料スライドの表紙です。スライド画像、または下の要約文中の青いページ番号リンクをクリックすると、別のタブで無駄なノイズのない、純粋なPDFビューア画面が起動し、指定されたページへ直接ジャンプして快適に閲覧できます。
全体概要
本セミナー「AIとグラフ――GPT4oと遊ぶ」は、現代の生成AI技術が持つ能力の非対称性、すなわち「言語・画像の生成は得意でも、グラフという数学的対象の生成には根本的に失敗する」という事実を出発点として、そこに潜む深い問いを探求する内容です。[p.1], [p.6]
GPT-4oのDALL·Eを用いた詩からの画像生成は驚くほど高品質であり、また画像として与えられたグラフの隣接行列を導出するといったグラフ認識タスクでも相当の能力を示します。しかしながら、隣接行列を指定してそれに対応するグラフ画像を正確に生成させようとすると、何度フィードバックを与えて修正を試みても失敗を繰り返します。これは単なる実装上のバグではなく、現在の大規模言語モデルを基盤とする生成AIが、人間の持つ「数学的認識能力」を本質的にまだ取り込めていないことの表れだとセミナー発表者は主張します。[p.6], [p.7], [p.83], [p.84]
この問題を深掘りするため、セミナーはAIの世界をいったん離れ、複雑性理論の観点からグラフの認識・同型性判定がいかに本質的に困難な問題であるかを論じます。グラフの同型性問題(Graph Isomorphism)はNPに属することは明らかですが、PかNP完全かは依然未解決であり、Interactive Proofのアプローチを通じてその複雑さが鮮明に浮かび上がります。さらに興味深いことに、Interactive Proofは「証明者(Prover)」と「検証者(Verifier)」という二人のAgentによる対話として証明を再構成するという「証明観の転換」をもたらしており、これがAIのAgent Modelへの議論へと自然につながっていきます。[p.100], [p.102], [p.148], [p.163]
後半ではAIにおけるAgent Modelの台頭を実際の研究事例(RAG、ATM、AgentGym)で示しつつ、最終的にはグラフをカテゴリー論的に「C-Set(Functor)」として捉えるAlgebraicJuliaのCatlabライブラリーや、Tai-Danaeの大規模言語モデルへのco-presheaf意味論導入の仕事が、言語理解と数学的対象の理解を深い数学的基盤で統一する可能性を示唆するという展望で締めくくられます。[p.247], [p.248], [p.250], [p.251]
講義のロードマップ
■ Part 1: 画像とグラフの違いを考える
- この部の核心:
GPT-4oはDALL·Eを通じた詩・テキストからの画像生成では卓越した能力を見せる一方、グラフの画像生成では根本的に失敗します。グラフの認識(隣接行列の導出)は成功するのに、生成は失敗するという「知覚と生成の非対称性」がこのPartの中心テーマです。この非対称性は、グラフという数学的対象がembeddingによる近似表現になじまない性格を持つことと深く関係しており、言語的認識と数学的認識の本質的な違いを示唆します。[p.6], [p.83], [p.84], [p.85]
- 論理展開:
- DALL·Eによるテキスト→画像生成の成功例として、フランス語詩「Ame sentinelle」からの幻想的画像生成が提示されます。[p.10], [p.11], [p.12], [p.13]
- グラフ認識タスクでは、6種のグラフ画像(ノード2〜3個)について正確にエッジの方向・構造を解釈し、カテゴリー論のProduct・Pullback・Natural Transformationのdiagramの隣接行列まで導出できることが示されます。[p.24], [p.40], [p.43], [p.46]
- しかし隣接行列 $A=\begin{pmatrix}0&1&1\\0&0&0\\0&0&0\end{pmatrix}$ を与えてグラフ生成を試みると、7回以上の修正を経ても双方向エッジや余分なエッジが混入し続けるという失敗が示されます。[p.58], [p.61], [p.65], [p.67], [p.69], [p.70], [p.71], [p.72]
- 最終的にGPT-4o自身がPython/NetworkXによるプログラム生成を提案し、コードは正しいグラフを出力しますが、これはマルチモーダルAIへの期待とは異なる「迂回路」であると評価されます。[p.76], [p.77], [p.81], [p.82]
■ Part 2: グラフの認識の難しさ
- この部の核心:
グラフの同型性(Graph Isomorphism)という問題を複雑性理論の観点から検討し、AIがグラフを扱えないことが偶発的バグではなく数学的に本質的な困難であることを論じます。さらにInteractive Proofというフレームワークを通じて、「証明者」と「検証者」というAgent的存在の対話として数学的証明を再定義するという証明観の転換を提示し、確率的証明論の扉を開きます。[p.102], [p.103]
- 論理展開:
- グラフの同型性の定義:頂点の置換 $f$ がエッジを保存する($c(i,j)=c(f(i),f(j))$)ことが条件であり、頂点数 $n$ に対してチェックすべき置換は $n!$ 個存在します。Graph IsomorphismはNPに属することは自明ですが、PかNP完全かは未解決です。[p.125], [p.126], [p.128]
- 具体例として4頂点・6頂点・8頂点のグラフ同型の例(見た目は異なるが置換により同一と判定)が示されます。[p.111], [p.114], [p.118]
- Interactive Proofのプロトコル:VerifierがランダムにスクランブルしたグラフHをProverに送り、ProverがG₀/G₁のどちらから生成されたかを返す。G₀≇G₁なら全知のProverは確実に識別できるが、G₀≅G₁なら1/2の確率でしか正解できないという「グラフ非同型性の確率的証明」が1986年 Goldreich・Micali・Wigersonにより示されます。[p.146], [p.147]
- Interactive Proofの哲学的意義:「正しいと検証されたものが正しい証明」という証明の検証側からの再定義と、確率的証明可能性(PCP定理、MIP*=RE定理)への展開が概説されます。[p.154], [p.155], [p.158], [p.159], [p.161], [p.162]
■ Part 3: AIのAgent-Based Model
- この部の核心:
現在のAI技術の弱点(数学的能力の欠如・外部実在への無関心)を補う方向として、Agent Modelへの注目が高まっていることを実例で示します。フォン・ノイマンの自己複製機械を歴史的出発点に置き、RAG・ATM・AgentGymという三つの具体的研究を通じて、外部環境と相互作用しながら自己進化するLLMベースAgentの設計原理を解説します。[p.167], [p.172]
- 論理展開:
- フォン・ノイマンの自己複製機械(1948/1949):運動モデルと細胞オートマトンモデルの二段階で、「自己複製のためには機械本体とは別に遺伝情報のコピーが必要」という洞察が示されます。これがAgent Systemの概念的起源とされます。[p.173], [p.178], [p.181]
- RAG(Retrieval-Augmented Generation, 2020):LLM(第一Agent)と検索Agent(第二Agent)の協働により、外部知識データベースへのリアルタイムアクセスを実現。ハルシネーションの軽減・説明可能性の向上・最新情報の反映が主な利点です。[p.192], [p.194], [p.196], [p.198]
- ATM(Adversarial Tuning Multi-Agent System):ATTACKERがFabrication(偽ドキュメント)を生成し、GENERATORが偽情報を見破る能力を高める敵対的チューニングにより、RAGの脆弱性を克服します。Jailbreak攻撃への防御や視覚言語モデルのRobust CLIPへの応用も紹介されます。[p.203], [p.208], [p.209], [p.204], [p.206], [p.207]
- AgentGym(復旦大学):14種類の環境・89種類のタスクを横断する統一プラットフォームで、AGENTEVOLアルゴリズムにより環境フィードバックからの自己進化を実証。WebShop・BabyAIの事例では進化前後で報酬が0→1に改善し、GPT-4-Turboに匹敵する性能が示されます。[p.217], [p.218], [p.222], [p.224], [p.228], [p.231], [p.240]
■ 理論的展望: C-Setとしてのグラフと統一的基礎
- この部の核心:
セミナーの結論として、グラフという数学的対象を「カテゴリーCから集合のカテゴリーSetへのFunctor(C-Set)」として捉えるAlgebraicJulia/Catlabのアプローチが紹介されます。これはTai-Danaeが大規模言語モデルの意味論にco-presheafを導入した仕事と共通の数学的枠組みを持ち、言語理解と数学的対象の理解が深い共通基盤でつながる可能性を示唆します。[p.247], [p.248], [p.250], [p.251]
- 論理展開:
- John Baezによる「Agent-Based Models(Part 1〜12)」blogシリーズと、AlgebraicJulia上のCatlabライブラリーが次回セミナーの主題として予告されます。[p.244], [p.245]
- 「Graph = C-Set」という定式化により、グラフのスキーマ定義からコンピュータ上の実装までを一貫して行うことが可能になり、数学の基礎構造そのものがグラフで表現されるという視点が提示されます。[p.248], [p.252]
- 言語のcategory $L$ から意味のcategory $Set^L$(Lから集合へのFunctorの全体)への対応図が示され、言語理解・画像理解・グラフ理解の統一的数学的基礎の展望が描かれます。[p.251]
