講演資料


講義資料スライドの表紙

講義資料スライドの表紙です。スライド画像、または下の要約文中の青いページ番号リンクをクリックすると、別のタブで無駄なノイズのない、純粋なPDFビューア画面が起動し、指定されたページへ直接ジャンプして快適に閲覧できます。

全体概要

本セミナー「ボイス・アシスタントから見るAIの未来」は、丸山不二夫氏によって、Amazon EchoおよびGoogle Homeに代表されるコンシューマ向けボイス・アシスタントの現状と、その先に広がるAI技術の課題を多角的に論じたものです [p.1]

セミナーが根底に置く問いは、「ボイス・アシスタントは本当に『知能』を持つのか?」という一点に収斂します。現在市場に流通するスキルやアプリの大部分は、単純なプログラムの音声入出力化あるいはデバイスへのボイスコマンド化に過ぎず、「人工知能」の名にふさわしい知的パーソナルアシスタントの実現はこれからの課題であると、著者は率直に指摘します [p.5]

現在のボイス・アシスタントはディープラーニングによるSpeech2TextおよびText2Speechに立脚しており、音声と文字列の相互変換は可能になりましたが、それだけでは機械が真の意味で「理解する」には至りません [p.6]。それでもなお著者がこの技術を重要視する理由は、人間と機械の日常的インターフェースが自然言語に移行することで、コンシューマ市場における「知能」への要求が質・量ともに飛躍的に高まり、自然言語処理をはじめとする現在のAI技術の諸課題の解決に向けた強力な「淘汰圧」として働くことへの期待です [p.6], [p.7]

Larry Pageがかつて語ったように、Googleの検索エンジンがAIによって完成されるとき初めてGoogleのミッションは果たされます [p.3], [p.4]。この洞察はそのままボイス・アシスタントの未来にも通じており、セミナーはそのビジョンへ向けて、Intent/Slot/Entityモデルというアーキテクチャの進化、知識グラフとSchema.orgの限界、自然言語の意味理解という三層の問題を丁寧に解きほぐしていきます。

AlexaとGoogle Homeの開発モデルを比較・分析する中で、著者は「Alexaが知識検索能力を獲得するか、GoogleがそれをAPIで公開するとき、競争の第一幕は終わり次の段階へ進む」と展望します [p.7]。さらにAppendixでは、質問応答システムとしてこれまでの最良の達成であるIBM Watsonが蓄積した知見、特に英文スロット文法(ESG)と述語引数構造(PAS)、そして大規模ドキュメントからの知識フレーム自動抽出システムPRISMATICを詳しく取り上げ、真に「知的」なボイス・アシスタントを実現するために学ぶべき先行技術として提示しています [p.367], [p.394]

本セミナーは、現状への冷静な批評と、未来への技術的根拠に基づく期待を同時に携えた、AIの現在地を測るための精緻な技術地図です。


講義のロードマップ


■ Part I: ボイス・アシスタントの現状

  • この部の核心:

Amazon EchoとGoogle Homeが市場に登場した経緯と、対応アプライアンス・スキル・Smart Home応用・多言語対応・サードパーティ開発ツールまでを網羅的に俯瞰します。ボイス・アシスタントが「コンシューマ向け初のAIアプライアンス」としてどのような生態系を形成しつつあるかを具体的に示します [p.10], [p.11]

  • 論理展開:
  • Amazon EchoとGoogle Homeの発売時期と各国展開:Echoは2016年7月に米国で、Google Homeは同年11月に米国で発売開始、日本展開はそれぞれ2017年11月・10月 [p.13], [p.14], [p.15]
  • スキルの種類はAmazon Alexa Skills Kitで多様化し、音楽・情報提供・Smart Homeなど既存コンテンツの音声化が主流 [p.24], [p.25]
  • Smart HomeへのIoT応用はAlexa Compatible・Google Smart Homeデバイスタイプ(カメラ・ライト・サーモスタット等)・IFTTTを通じて拡張 [p.48], [p.53], [p.54], [p.55]
  • Google Cloud Speech APIは119言語をサポートし、多言語対応が急速に進展 [p.71]
  • Converse AI・PullString・gupshupなどのサードパーティ開発ツールが参入し、ノーコード・ローコードでのスキル開発が可能に [p.80], [p.83], [p.87]


■ Part II: Amazon EchoとGoogle Homeの開発モデル/開発環境

  • この部の核心:

AlexaのIntent Modelの歴史的進化(Intent → Intent+Slot → Intent+Slot+Entity)と、Google HomeのAssistant SDK・Dialogflow SDK・Action SDKという三層の開発環境を比較分析します。両者の設計思想の共通点と相違点を技術的に精査することで、ボイス・アシスタント開発の現在地を明示します [p.89], [p.90], [p.91], [p.92]

  • 論理展開:
  • AlexaのIntent Modelは最初期のSampleUtterance.txtによる純粋なIntentマッピングから出発し [p.100], [p.101], [p.102]、Slotによる引数の導入 [p.114], [p.117], [p.118]、System Slot TypeとCustom Slot TypeおよびEntity Resolutionの追加 [p.97], [p.127]、Built-in Intent LibraryとIntent Signatureの導入へと段階的に進化 [p.98], [p.99], [p.129], [p.130]
  • Alexaの代表的サンプル「History Buff」では、全365日×複数表現のSampleUtteranceを手書きで列挙する原始的な手法の限界が示される [p.107], [p.108], [p.109], [p.110], [p.111]
  • Google Homeの開発環境はGoogle Now/Voice Searchの資産を引き継ぎ [p.149], [p.151], [p.152]、Assistant SDK(音声データをそのままサーバに渡す)[p.173], [p.174]、Dialogflow SDK(Alexa対抗のIntent-Slotモデル)[p.191], [p.150]、Action SDK(シンプルなボイスコマンド向け)[p.220]の三系統で構成される。
  • DialogflowはFulfillmentとCloud Functionsを組み合わせることで外部の天気予報APIを呼び出す形で実装され、知識そのものはシステムの外部に依存する構造が示される [p.203], [p.205], [p.206], [p.207], [p.208]


■ Part III: ボイス・アシスタントから見るAIの課題

  • この部の核心:

「ボイス・アシスタントは知識を持つか」という根本的問いを軸に、知識グラフの探索・Schema.orgのEntityモデルの限界・知識データベース構築の試み・文の意味理解という四つの問題圏を順に論じます。Larry Pageの「検索エンジンのAI完全化」というビジョンと現実の技術的ギャップを、具体的なAPIの挙動や仕様の分析を通じて明確化します [p.221], [p.222]

  • 論理展開:
  • AlexaとGoogle Now・Cortana・Siriの知識応答能力比較(元素番号98、モーツァルトの最後の交響曲、映画俳優名)で、ボイス・アシスタント間の知識格差が明示される [p.224], [p.225], [p.226]
  • 2010年代の大規模データ処理の転換:バッチ処理からリアルタイム処理へ、さらにFacebookのOpen GraphとGoogleのPregelに代表されるグラフデータ処理の重要性が台頭 [p.232], [p.233], [p.235]。GoogleのKnowledge Graphは2012年にEntityモデルに基づく知識グラフ検索として定式化される [p.236]
  • Google Knowledge Graph Search APIはSchema.orgのEntityにアクセスできるが機能は大きく制限されており、Taylor SwiftのEntityには誕生日が登録されていてもAPIからアクセスできないという具体的問題が示される [p.264], [p.265], [p.266], [p.267], [p.170]
  • Schema.orgはGoogle・Microsoft・Yahoo・Yandexが支援する標準だが、体系性・網羅性においてWordNetに劣り、Language・Economy・Mathematicsといった概念の記述に限界が明確 [p.274], [p.275], [p.290], [p.291], [p.292], [p.293], [p.294]
  • 知識データベース構築の試みとして、Wikipedia InfoboxからのDBpedia自動抽出 [p.302], [p.303]、Wikidata(WikimediaによるEntityベースの共同編集知識ベース)[p.312], [p.313], [p.314]、BabelNet(WordNetとWikipediaを統合した多言語セマンティックネットワーク、271言語・1400万シンセット)[p.319], [p.320], [p.322], [p.323]が紹介される。
  • AlexaのIntent Signatureは`AMAZON.SearchAction`という形式でSchema.orgのActionモデルとEntityモデルを組み合わせ、発話の意味を「Action・Entity・Property」の三層構造で解釈する試みとして位置づけられる [p.328], [p.329], [p.331], [p.334], [p.335], [p.336], [p.337], [p.338]。文の意味理解のレベルとして、表層のUtteranceマッチングから述語引数構造の抽出へという方向性が示されるが、現状はその入り口に過ぎないと評価される [p.360], [p.363]


■ Appendix 1: IBM Watson(旧)の取り組みから学ぶ

  • この部の核心:

質問応答システムとして歴史的到達点を示したIBM Watsonが採用したSlot Grammar(ESG)・述語引数構造(PAS)・知識フレーム自動抽出(PRISMATIC)という三層のアーキテクチャを詳解します。現在のボイス・アシスタントが未だ持ち得ていない「深い意味理解」の技術的実装として、今後に学ぶべき知見が凝縮されています [p.367]

  • 論理展開:
  • ESG(English Slot Grammar)はMichael C. McCordが開発した枠組みで、文をsubj・obj・iobj等のSlotで構文解析し、さらにWord Senseとの対応づけによって「Mary gave a book to John」を∃e∃y(book(y) ∧ give1(e, Mary, y, John))という論理式で表現する表層構造・深層構造の二層分析を実現する [p.368], [p.371], [p.372], [p.381], [p.382], [p.383], [p.384]
  • PAS(述語引数構造)ビルダーはESGの詳細な解析結果を単純化・抽象化し、大量データ処理に適した形式に変換する [p.390], [p.391], [p.392], [p.393]
  • PRISMATICはWikipedia等30GBのドキュメントから10億個の知識フレームを自動生成し、動詞"annex"の目的語型が統計的に「地域」であることなどを推定することで、未知語の型推論(LAT推定)にも活用される [p.394], [p.395], [p.398], [p.399], [p.403], [p.404], [p.405], [p.406], [p.407]
  • Watsonの質問分析では、Focus(答えを指す要素)・LAT(Lexical Answer Type)・Question Classificationの検出がESGとPrologルールの組み合わせで実装される [p.408], [p.409], [p.410], [p.411], [p.417], [p.418]


■ Appendix 2: ボイス・アシスタントのSmart Home/IoTへの応用

  • この部の核心:

AlexaのスマートホームスキルAPIとGoogleのSmart Home APIの具体的なメッセージ交換プロトコルを示し、音声コマンドがデバイス制御へと変換されるエンドツーエンドのアーキテクチャを解説します [p.420], [p.421], [p.436]

  • 論理展開:
  • AlexaのスマートホームスキルAPIは「インターネット経由接続(スキル実装が必要)」と「ハブ経由接続(ZigBee等)」の二方式を提供 [p.424]。Directive(ユーザー認証・デバイスID・新設定値を含む)をLambda関数で受け取りデバイスクラウドに転送、EventでAlexaに応答返却という同期・非同期の双方向メッセージングを実現 [p.429], [p.430], [p.432]
  • Google Smart HomeはHome Graphデータベースを中核に、action.devices.SYNC(デバイス検出)・EXECUTE(コマンド実行)・QUERY(状態照会)の三Intentで構成されるプロトコルで動作する [p.437], [p.438], [p.440], [p.444], [p.447]