Skip to content

Smart Glasses向けAIアシスタント統合PoC

本PoCでは、Smart Glasses向けに音声・画像・翻訳・対話機能を統合し、ハンズフリーAIの実現可能性を検証しました。Smart Glassesで取得した音声・画像データをAndroidアプリと連携し、複数のAI機能を組み合わせました。

PoCの課題

01.日本語音声認識

自然な言い回しや文脈を理解し、日本語コマンドの認識精度を高める必要がありました。

02.デバイス間連携

Smart Glassesで取得した音声・画像データを、Androidアプリへ安定的に連携する必要がありました。

03.ハンズフリーAI体験

音声・画像・翻訳・対話を組み合わせ、操作負担の少ないAI体験を検証する必要がありました。

PoCで検証したポイント

01.日本語Intentの最適化

LLMによる文脈理解を活用し、自然な問いかけや音声コマンドに対する認識精度の向上を検証しました。

02.安定したデバイス接続

Bluetooth通信を最適化し、Smart GlassesとAndroidアプリ間の安定したデータ連携を確認しました。

03.4つのAI機能の統合

音声コマンド処理、画像認識、リアルタイム翻訳、LLMベースのAIチャットボットを統合し、AndroidアプリのPoC構築とUATを完了しました。

想定ユースケース

01.リアルタイム翻訳アシスタント

海外旅行中にカメラで捉えた看板や標識を読み取り、日本語で翻訳・解説します。

02.会話からのToDo自動化

会話から重要事項とタスクを抽出し、期限・優先度を推測してスマートフォンのToDoへ登録します。

Agentic AIへの発展構想

質問に応答するReactive AIから、状況に応じて提案するProactive AI、さらにタスクを実行するAgentic AIへ発展させ、単なる応答AIから実行可能なAIエージェントへの展開を想定しています。

01.位置・文脈に基づく提案:位置情報や文脈に基づき、自動でリマインドを提案します。

02.On-device AIとクラウドAI:低遅延と端末制約を考慮し、On-device AIとクラウドAIを組み合わせます。

使用技術

LLM|STT/TTS|画像認識AI|Bluetooth通信最適化|Androidネイティブ