AIの進化を、ニュースで終わらせない。

製品・サービス · ·

会話を続けながら作業を進めるGemini 3.8 Liveがリリース

複雑な依頼への対応力と、相づちや割り込みへの対応では2モデルの評価が分かれた。日本語への対応、会話全体にかかる費用、アプリごとの提供範囲を解説する。

音声で頼みごとをした後、AIが調べ終わるまで黙って待つ時間を減らせるか。Googleの新しいLiveモデルは、会話と作業を同時に進める。話しやすさと仕事を完了する力の違いから、2モデルの使い分けを考える。

この記事の要点

  1. 会話を続けながら外部サービスの処理を進められ、Extended Thinkingは裏で複雑な検討も行う。
  2. 第三者評価では、手順の多い顧客対応の課題を完了した割合はExtended Thinking、相づちや割り込みへの対応は通常のLiveが高かった。
  3. 日本語を含む97言語に対応するが、アプリや契約プランによって利用できる範囲は異なる。
Gemini 3.8 LiveとExtended Thinkingの公式発表画像
出典:Google

出来事

  • Googleが9月15日、日本時間16日午前2時に Gemini 3.8 Live と Extended Thinking を発表した。
  • Gemini APIとGoogle AI Studioで提供。一般向けアプリには順次展開し、Gemini Enterpriseでは参加者を限定したプレビューとなる。
  • 音声のAPI単価は両モデルとも100万トークンあたり入力3ドル・出力12ドル。

一次情報:Googleの発表、開発者向けの案内、料金表

調べ物や予約の処理をしながら会話を続けられる

Google が発表したのは、Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking の2モデルだ。どちらも音声を受け取り、音声で返す。外部サービスへの問い合わせや処理を待つ間も、利用者との会話を続けられる。

通常の Live は素早いやり取りや単純な指示、Extended Thinking は複数の手順が必要な仕事を想定している。Google の開発者向け資料では、前者の用途に音声検索や語学練習、後者に旅行の手配や、複数の情報を調べる技術サポートを挙げている。

例えば、旅行の日程を相談しながら航空便とホテルを調べ、結果がそろったところで候補を比べる、といった使い方だ。Extended Thinking は検討や処理を裏で進め、その間にも進捗を声で伝えられる。返答を待つ無言の時間を減らせる点が、単に音声を文字に直して質問する仕組みとの違いになる。

ただし、予約サイトを含むどんなサービスでも、モデルだけで使えるわけではない。実際の予約や社内データの照会には、アプリ側が接続先と操作手段を用意する必要がある。発表で紹介された実演と、一般向けアプリでそのまま利用できる機能は分けて見る必要がある。

複雑な依頼ではExtended Thinkingの成績が高い

第三者機関 Artificial Analysis の音声モデルの評価では、総合指標の Speech to Speech Index が、Live は76.0、Extended Thinking は82.6だった。前モデル Gemini 3.1 Flash Live の推論量を高くした場合の71.5を、どちらも上回った。

この指数は、音声で出された問題を解く力、顧客対応の課題を完了する力、人が会話を比べた際の好みなど、4つの成績をまとめたものだ。82.6という数値は、日常の依頼の82.6%を成功させるという意味ではない。

差が大きかったのは、航空便の変更や返品などを模した顧客対応の試験 τ-Voice だ。課題の完了率は Live が30.1%、Extended Thinking が68.6%だった。単に返事ができたかではなく、規定に従って必要な操作を行い、データを正しい最終状態にできたかを調べている。

一方、相づち、話し手の交代、割り込みなどへの対応を測る Full Duplex Bench では、Live が96.1%、Extended Thinking が91.9%だった。複雑な依頼への対応で優位なモデルが、会話の細かなやり取りでもすべて上回るわけではない。Extended Thinking の測定は、推論量を高くした条件による。

Gemini 3.8 LiveとExtended Thinkingのエージェント評価を比較する図
出典:Google
図12モデルの音声評価

いずれも数値が高いほどよい。Extended Thinkingは推論量を高くした条件で測定。指標ごとに、どちらが高いかは異なる。注1

  • 総合指数Speech to Speech Index

    3.8 Live76.0

    Extended Thinking82.6

  • 顧客対応の課題完了率τ-Voice

    3.8 Live30.1%

    Extended Thinking68.6%

  • 相づちや割り込みへの対応Full Duplex Benchの4項目をまとめた成績

    3.8 Live96.1%

    Extended Thinking91.9%

複雑な依頼の完了率はExtended Thinkingが高く、会話の運び方の評価は通常のLiveが高い。日本語に限定した評価ではない。

第三者の測定Artificial Analysis の評価に基づく。9月15日の保存版で確認。総合指数は成功率ではない。各試験の定義は同機関の説明に従った。

日本語を含む97言語で会話できる

Google は、会話の途中で言語を切り替えられると説明している。Live APIの対応言語一覧には日本語も含まれ、対応数は97言語となっている。

両モデルは、音声に加えて文字や画像や動画を入力できる。カメラで見せたものについて質問するなど、目の前の状況を踏まえた会話に使える。Google は、盤面を見ながらチェスをする例や、手描きの図と音声の指示から画面を作る例を紹介した。

言語への対応と、その言語での仕事の精度は同じではない。先ほどの評価は、日本語での氏名や住所の聞き取り、敬語、固有名詞を含む予約手続きの精度を示したものではない。日本語の窓口で使うなら、実際に扱う言葉や周囲の雑音を含めて確かめる必要がある。

APIの単価は同じでも会話全体の費用は変わる

Google の料金表では、Live と Extended Thinking のAPI単価は同じだ。有料枠の通常料金は、100万トークンあたり音声入力が3ドル、音声出力が12ドル。文字の入力は0.75ドル、推論に使った分を含む文字の出力は4.50ドルとなる。

開発者向けの発表には、音声入力が1分あたり約0.005ドル、音声出力が約0.018ドルという目安もある。ただし、これは入力と出力それぞれの音声量を料金に換算した値だ。両方を足して、通話時間を掛ければ請求額が分かるというものではない。

理由の一つは、会話履歴への課金にある。Live APIは、やり取りのたびに、その時点で保持している過去の会話も入力として処理する。履歴に残した音声は再び入力料金の対象となり、会話が長くなるほど1回の応答にかかる費用も増え得る。音声の文字起こしを有効にした場合は、その文字の出力にも別途料金がかかる。

また、2モデルでは、受け取った音声に応答するかをモデルが判断する「Proactive Audio」が常に有効になっている。Live APIが音声を聞いている間は、応答しなくても入力料金がかかる。出力料金は応答したときにかかる。

推論に使う量、AIが話す長さ、残しておく会話履歴によって、総額は変わる。同じ単価でも Extended Thinking のほうが多く処理すれば費用は増えるため、比べるべきなのは1分の目安だけでなく、目的の仕事を終えるまでの費用だ。

図2APIの音声と文字の料金

100万トークンあたりの米ドル建て料金。LiveとExtended Thinkingに共通する有料枠の通常料金。

  • 音声利用者の音声を受け取りAIが音声で返す

    入力$3.00

    出力$12.00

  • 文字出力には推論に使うトークンも含む

    入力$0.75

    出力$4.50

料金は使用量で決まる。会話履歴の再処理や文字起こしなども費用に影響するため、通話時間だけでは計算できない。

公式料金Gemini APIの料金表とLive APIの課金規定に基づく。画像・動画入力や検索にかかる料金は、この表には含めていない。

アプリと法人向けサービスで提供範囲が異なる

発表当日の案内では、開発者は両モデルを Gemini API と Google AI Studio で使える。法人向けの Gemini Enterprise では、参加者を限定したプレビューとして提供する。すべての法人顧客への一般提供とは案内されていない。

一般向けでは、通常の Live は Search Live、Extended Thinking は Gemini Live への展開を始める。いずれも順次提供する案内であり、発表時点で全員が新モデルに切り替わったことを意味しない。

Google Workspaceでは、DocsはGoogle AI ProとUltraの利用者、GmailとKeepはGoogle AIの有料プランの利用者が対象となる。Workspaceの法人顧客と、Gemini Enterprise for Customer Experienceには、今後提供するとしている。

同じ Live という名称でも、開発者がAPIで作るアプリと、Googleが提供するアプリでは、使える操作や利用条件が異なる。APIが日本語に対応していることだけで、日本の全アカウントで新機能が使えるとは判断できない。

返事が来ても裏の作業は終わっているとは限らない

会話と処理を同時に進める仕組みでは、返事が途切れたことと、仕事が終わったことを区別する必要がある。Google のExtended Thinking の仕様でも、ひとまとまりの発話が終わった後に、検討や外部サービスの処理が続く場合があると説明している。

予約を受け付けたと返事をしても、まだ空き枠を調べている途中かもしれない。利用者にとって重要なのは、話しかければすぐ答えることに加えて、依頼した操作がどこまで進み、何が確定したかが分かることだ。会話を途切れさせない工夫と、完了を正しく伝える設計はセットで必要になる。

今回の2モデルは、音声で頼める仕事の範囲を広げる。ただ、導入先によって求めるものは違う。語学練習なら会話の間や割り込みへの対応、予約窓口なら条件の確認や手続きの完了までを比べるほうが、総合順位だけで選ぶより用途に合った判断ができる。

出典・参考資料

更新履歴

  • 公開しました。
  • 要点の性能比較が指す試験の範囲を訂正し、応答しない間も音声入力に料金がかかる条件を補足しました。

LATENTでは、記事の改善のためGoogle Analytics(Firebase)によるアクセス解析を利用します。許可するとCookie等で閲覧・操作情報をGoogleに送信します。プライバシーポリシー