Gemini 3.8 Liveとは?会話を止めずにツールを動かす音声AI|Extended Thinking・Live Avatar・料金を解説

当サイトではアフィリエイト広告を利用しています。

Googleは2026年9月15日、リアルタイム音声対話向けのGemini 3.8 Liveと、複雑な処理向けのGemini 3.8 Live Extended Thinkingを発表しました。

Gemini 3.8 Liveの大きな変化は、会話を続けたまま、検索や予約、社内システムなどのツール・APIをバックグラウンドで動かせることです。

さらに9月24日には、映像付きの会話エージェントを作るLive AvatarがGemini Enterpriseで一般提供(GA)になりました。カメラや画面を見ながら話す機能も含め、音声AIが「質問へ答える」だけでなく、会話中に仕事を進めるエージェントへ近づいています。

この記事では、Gemini 3.8 LiveとExtended Thinkingの違い、非同期ツール実行、Live Avatar、日本語対応、料金、Gemini Liveとの関係、実際に導入するときの注意点までまとめます。

Gemini 3.8 Liveは「会話」と「作業」を並行できる音声AI

Gemini 3.8 Liveでは、人が話している時間と、AIがツールを動かす時間を切り離せます。

例えば航空券の予約を同期型のツール呼び出しで処理すると、次のような流れです。

  1. ユーザーが航空券の予約を依頼する
  2. AIが空席検索APIを呼ぶ
  3. APIの結果が返るまで会話が止まる
  4. 結果を受け取ってAIが候補を返す

Gemini 3.8 Liveでは、ツール呼び出しを非同期で動かしながら、AIは「空き状況を確認しています」などと応答し、そのまま会話を続けられます。

Gemini 3.8 Live関連のモデル・機能は次のように分かれます。

名称主な役割現在の位置づけ
Gemini 3.8 Live低遅延のリアルタイム音声対話多くの音声エージェント向けの基本モデル
Gemini 3.8 Live Extended Thinking複雑な多段処理、バックグラウンド推論深い推論が必要な音声エージェント向け
Live Avatar音声に同期する映像アバターGemini EnterpriseでGA
Gemini Live一般ユーザーが使うGeminiの会話機能製品側の体験。APIモデル名とは別に考える

Gemini 3.8 Liveはモデル、Gemini Liveはユーザー向け機能名です。また、Live Avatarも一般向けGemini Liveへそのまま追加された機能ではなく、執筆時点ではGemini Enterprise向けとして提供されています。

会話を止めずにツール・APIを動かせる

Gemini 3.8 Liveの中核になるのが、非同期のFunction Callingです。

モデルIDはgemini-3.8-liveで、現在のGemini APIドキュメントでは非同期実行のNON_BLOCKINGが標準になっています。ツール側の処理が終わるまでモデル全体を待たせるのではなく、会話を続けながら処理結果を待てます。

例えば航空券の予約なら、

  • ユーザーと希望条件を話す
  • 裏で空席検索APIを動かす
  • 結果を待つ間に時間帯や座席の希望を追加で聞く
  • API結果が届いたら候補を会話へ戻す

という動かし方ができます。

Googleの発表では、Gemini 3.8 LiveがツールやAPIをバックグラウンドで実行しながら会話を継続できることを明確にしています。

リアルタイムの問い合わせ窓口、予約、社内ヘルプデスク、トラブル対応では、AIの返事を待つ時間と業務処理を重ねられるため、利用者が処理待ちで会話を中断する時間を減らせます。

Extended Thinkingは複雑な多段処理向け

通常のGemini 3.8 Liveは、低遅延を重視する多くの音声エージェント向けです。

より複雑な仕事にはgemini-3.8-live-extended-thinkingが用意されています。

Extended Thinkingでは、会話を続けながらバックグラウンドで推論を進められます。APIではthinking_levelをlow、medium、highから設定でき、多段階の判断や複数ツールを使う処理へ向けて思考量を調整できます。

一方、通常版のGemini 3.8 Liveではthinking_levelを指定しません。

項目Gemini 3.8 LiveExtended Thinking
向く用途低遅延の会話、一般的な音声エージェント複雑な予約、調査、多段処理
Thinkingインターリーブ推論バックグラウンド推論を調整可能
thinking_level指定しないlow / medium / high
Function Calling非同期が標準、互換用の同期実行も可能非同期のみ
会話中のバックグラウンド処理対応対応

Extended Thinkingでは、turnCompleteだけではバックグラウンド処理の完了を判断できません。開発側はinteraction_statusでIN_PROGRESSかIDLEかを確認する設計が必要です。

Extended Thinkingを使う場合は、音声エージェントのクライアント側も非同期処理を前提に作る必要があります。

カメラや画面を見ながら会話できる

Gemini 3.8 Liveは、テキスト、画像、音声、動画を入力できます。カメラ映像や画面共有を会話と一緒に送り、見えている内容を踏まえて応答できます。

Googleは、社員オンボーディングで画面を見ながら質問へ答える例や、映像を見ながらチェスを進める例を公開しています。

この仕組みは、

  • 機器をカメラで映しながら修理手順を聞く
  • 画面共有しながら操作方法を案内してもらう
  • 商品や書類を映して内容を確認する
  • 現場映像を見せながら受付や報告を進める

といった用途につながります。

音声AIが「耳」だけでなく「目」も持ち、さらにツール実行まで組み合わせられる形です。

日本語に対応。対応言語数は更新が続いている

Live APIの現行ドキュメントには日本語(ja)が対応言語として掲載されています。

2026年9月15日の発表時点では97言語の自動検出・切り替えに対応すると案内されていました。その後、Gemini APIの機能ガイドでは99言語と記載されている版も確認できます。

対応言語数が短期間で更新されているため、固定した数字だけを見るより、実際に使う言語が現行リストへ含まれているかを確認する方が確実です。

日本語は現行リストに含まれており、ネイティブ音声モデルは会話中に言語を切り替えることもできます。

日本語の音声品質は、固有名詞、騒音、マイク品質、話し方、方言などの条件で変わります。本番導入では、実際の利用環境に近い音声で確認する必要があります。

Live Avatarは企業向けの映像付き会話エージェント

Googleは2026年9月24日、Gemini 3.8 Live with Live AvatarをGemini Enterpriseで一般提供しました。

Live Avatarでは、音声に同期して口の動きや表情を生成し、Web、モバイル、キオスクなどで映像付きの会話エージェントを作れます。

主な用途は次の通りです。

  • カスタマーサポート
  • 受付
  • 商品・サービス案内
  • 研修・オンボーディング
  • 手続き案内

企業は用意されたアバターを利用でき、独自アバターの作成は許可リストと本人確認を含む審査の対象です。生成された音声と動画にはSynthIDが付与されます。

提供地域はGemini Enterprise側で米国・EUのエンドポイントが案内されています。

Live AvatarがGAになったのはGemini Enterpriseです。 一般ユーザー向けのGemini Liveへ、同じ映像アバター機能が標準提供されたという発表ではありません。

API料金は入力音声と出力音声で別に計算する

2026年9月27日時点のGemini Developer APIでは、Gemini 3.8 LiveとExtended ThinkingのStandard料金は共通です。

処理有料枠の料金
テキスト入力0.75ドル / 100万token
音声入力3.00ドル / 100万token、または約0.005ドル/分
画像・動画入力1.00ドル / 100万token、または約0.002ドル/分
テキスト出力4.50ドル / 100万token
音声出力12.00ドル / 100万token、または約0.018ドル/分

音声入力が1分、音声出力も1分なら、それぞれ別に課金されます。「通話1分あたり0.023ドルで固定」という料金ではありません。ユーザーが話している時間、AIが話している時間、会話履歴、映像入力などによって実際の利用量が変わります。

さらにLive APIは会話履歴をコンテキストとして持ち続けるため、長いセッションでは過去のトークンも再処理され、1ターンあたりのコストが増えていきます。

料金ページでは、Google製品の改善へのコンテンツ利用について、無料枠は「Yes」、有料枠は「No」と区別されています。業務データを扱う場合は、価格とあわせてデータ利用条件も確認する必要があります。

長時間会話はセッション管理が必要

Live APIはWebSocketで接続し、音声や映像を継続的に送受信します。

圧縮を使わない場合のセッション上限は、

  • 音声のみ:15分
  • 音声+動画:2分

です。

一方、コンテキストウィンドウ圧縮を使えば、セッション自体は継続できます。また、WebSocket接続はおよそ10分で更新されるため、Session Resumptionを使って同じ会話を新しい接続へ引き継げます。再開用トークンはセッション終了後2時間有効です。

そのため、コールセンターや長い相談を想定する場合は、「モデルが長時間話せるか」だけでなく、

  • 接続再開
  • コンテキスト圧縮
  • コストの増加
  • ツール処理中の状態管理
  • 通信切断時の復旧

まで含めて設計する必要があります。

Gemini API・Gemini Enterprise・Gemini Liveで提供状況が違う

Gemini 3.8 Liveは複数のGoogle製品へ展開されていますが、同じ提供状態ではありません。

開発者向け

Gemini APIとGoogle AI Studioではgemini-3.8-liveとgemini-3.8-live-extended-thinkingを利用できます。各モデルページではStableとして掲載されています。

Live APIの機能ガイド自体にはPreview表記が残っています。モデルのリリース段階とLive API全体の位置づけは別々に確認する必要があります。

企業向け

Gemini Enterprise Agent Platformでは、9月24日にGemini 3.8 LiveがGAになりました。Live Avatarも同日に一般提供されています。

Extended Thinkingは、9月24日のGoogle Cloud発表時点ではGemini EnterpriseでPrivate Previewです。

一般ユーザー向け

Googleは9月15日の発表で、Gemini Liveなど一般向け製品にも3.8 Live系を展開すると案内しています。

日本ではGeminiアプリ自体が提供され、Gemini Liveも利用できます。一般向け画面では、利用中のLiveモデル名が常に明示されるわけではありません。

公開直後の利用者投稿でも、「自分のGemini Liveが3.8へ切り替わったのか判別しにくい」「有料アカウントでも変化が見えない」という声がありました。モデルIDを指定できるAPIと、段階的に更新される一般向け製品では、提供状況の確認方法が異なります。

公開直後は既存実装からの移行にも注意

旧3.1 LiveからGemini 3.8 Liveへ移行する場合は、モデル名以外にもクライアント側の変更点があります。

公式の移行ガイドでも、

  • 非同期Function Callingが標準になった
  • send_client_contentの扱いが変わった
  • Proactive Audioが常時有効になった
  • 映像フレームが標準でターンへ含まれる

などの変更が案内されています。

GitHubでも、Firebase Android SDKにExtended Thinking向けのthinking_levelやinteraction_statusなどのAPI追加を求めるIssueが公開されています。また、別の音声エージェント実装では、無音区間の扱いが3.8 Liveと合わず返答が始まらない問題が報告され、修正が進められました。

Redditでも3.1 Liveから移行して問題が出たため戻したという開発者報告があります。

GitHubのIssueや利用者報告では、3.8への移行時に非同期処理やVAD(発話区間検出)など周辺実装の調整が必要になった事例が確認できます。個別の報告だけでGemini 3.8 Live全体の安定性までは判断できないため、既存環境から移行する場合は周辺実装も確認対象になります。

Gemini 3.5 Transcribeとは用途が違う

Googleは同じ音声AI群としてGemini 3.5 Transcribeも提供していますが、役割は異なります。

Gemini 3.8 Liveは、音声で対話しながら考え、映像を見て、ツールを使う会話エージェント向けです。

一方、Gemini 3.5 Transcribeは音声をテキストへ変換する文字起こし専用モデルです。

  • 会話しながら予約や検索を動かしたい → Gemini 3.8 Live
  • 複雑な多段処理まで音声で任せたい → Extended Thinking
  • 会議や動画を文字起こししたい → Gemini 3.5 Transcribe

Gemini 3.5 Transcribeの日本語対応、料金、Smart / Verbatim、Whisperとの違いはこちらの記事で詳しく紹介しています。

Gemini 3.5 Transcribeとは?日本語文字起こし・料金・Live API・Whisperとの違いを解説
Gemini 3.5 Transcribeの日本語対応、録音用とLive APIの違い、Smart・Verbatim、料金、話者識別、タイムスタンプ、Whisperとの使い分けを整理します。

どの用途ならGemini 3.8 Liveが合うか

Gemini 3.8 Liveの特徴が活きるのは、「話すこと自体」がUIになるサービスです。

問い合わせや予約を音声で完結させたい

低遅延の会話と非同期ツール実行を組み合わせられるため、予約、受付、カスタマーサポートと相性があります。

カメラや画面を見ながら案内してほしい

映像をリアルタイム入力できるため、製品サポート、操作案内、現場受付などに向きます。

一つの依頼で複数の処理を進めたい

複数工程の調査や予約、業務処理まで含む場合はExtended Thinkingが候補になります。

映像付きの企業向け窓口を作りたい

Gemini Enterpriseを使う前提ならLive Avatarで映像付きエージェントを構築できます。一般向けGemini Liveの機能としてではなく、企業向けの導入基盤として見る必要があります。

まとめ

Gemini 3.8 Liveは、リアルタイム音声AIを「会話しながら仕事を進めるAI」へ広げるモデルです。

中心になるのは、会話を続けたままツールやAPIを動かせる非同期処理です。カメラや画面の入力も扱え、複雑な多段処理にはExtended Thinking、企業向けの映像付き窓口にはLive Avatarが用意されています。

実際に導入する場合は、料金だけでなく、長時間会話のセッション管理や既存実装からの移行も確認が必要です。Gemini 3.8 Liveでは、返答の自然さや遅延に加えて、会話を止めずに裏でどこまで安全に仕事を進められるかも重要な評価軸になります。

公式情報・参照先

タイトルとURLをコピーしました