製品・サービス · · Team LATENT
Gemini 3.8 Flash TTS登場、GPT-Liveとの比較
Gemini 3.8 Flash TTSとGPT-Liveを、応答の速さを中心に比較する。初動と回答開始の違い、対応言語、7言語の音声評価、API料金を確認。測定条件の違いと2027年からの料金変更も整理した。
Googleが9月23日、Gemini 3.8 Flash TTSとFlash-Lite TTSを発表した。会話や読み上げでまず気になるのは、どれだけ待たずに声が返るかだ。GPT-Liveとの比較では、最初に音が出る速さ、答えを話し始める速さ、途中で割り込めるかを分けて見る必要がある。対応言語と音声の自然さ、料金も公開資料から比べた。
この記事の要点
- レスポンスの数字は測定条件が違う。GPT-Liveの英語アプリ実測は初動中央値1.099秒だが、英語以外の応答速度やAPI性能、Geminiとの勝敗を示す値ではない。
- 対応言語はGoogle公称でFlashが130、Liteが101。日本語の聴き比べ評価はFlash、英語などはLiteが上で、言語ごとに得意不得意がある。
- Flash TTSの現行出力料は1分0.0135ドル、GPT-Liveは接続中の時間に1分0.05ドル。生成音声とセッションでは課金対象が異なり、Googleの料金は2027年から変わる。

出来事
- Googleは9月23日付の発表で、声の表現を重視するFlash TTSと、大量生成や低遅延を重視するFlash-Lite TTSを紹介した。
- Gemini APIとGoogle AI Studioなどで提供する。今回比較する料金はGemini Developer APIのStandard有料枠とOpenAI APIの料金。
- 本記事は公開仕様と公表された評価の比較。LATENTによる音声の実測・試聴比較ではない。
一次情報:Googleの発表、GPT-Liveの仕様
レスポンスは最初の音と答えの開始を分けて見る
速さを優先するなら、まず測る時間をそろえたい。TTSの初動は、文章を送ってから最初の音声が返るまで。音声会話の応答時間は、利用者が話し終えてから返答が聞こえるまでで、発話終了の判定、音声認識、返答の生成、通信や再生の待ち時間も関わる。
さらに「確認します」という相づちがすぐ出ても、質問の答えは後から届く場合がある。最初の音が出るまで、意味のある答えが始まるまで、回答が終わるまでの3つを分ければ、会話のテンポと仕事が終わる速さを混同せずに済む。OpenAIも、GPT-Liveのバックエンド最適化では有用な音声応答までの時間とタスクの成功を同じシナリオで比べるよう案内している。GPT-Liveの遅延最適化
公表された秒数は同じ条件の速度ランキングではない
応答時間の具体的な数字はある。ただし、Gemini TTSの配信サービス上の統計と、GPT-Liveを使ったスマートフォンアプリの実測では、測定の入口も出口も異なる。
| 対象 | 公表値 | 何を測った値か |
|---|---|---|
| Gemini 3.8 Flash TTS | Latency P50 3.47秒 | OpenRouter経由のGoogle AI Studio。全地域・1週間の表示値 |
| Gemini 3.8 Flash-Lite TTS | Latency P50 2.66秒 | 同上。入力原稿や使用言語をそろえた試験ではない |
| GPT-Live 1 ChatGPTアプリ | 中央値 1.099秒 P90 1.203秒 | 英語で話し終えてから最初に音が聞こえるまで。Agoraが測定 |
比較条件OpenRouterのFlash・Liteは9月30日確認。P50は中央値、P90は観測の90%がその値以下となる目安。GPT-LiveはAgoraの7月9日実測。条件が違うため、この表からモデル間の速度比や最速を決めることはできない。
GPT-Liveの約1秒は英語アプリでの実測値
Agoraの測定は、iPhone 13、ChatGPTアプリv1.2026.183、Plusアカウント、英語、各条件30回で行われた。最初の音には相づちも含むため、実質的な回答が1.099秒で始まるとは限らない。割り込んでからAIの音声が止まるまでは中央値1.399秒だった。7月の単一端末・地点・アカウントによる英語の実測結果だ。英語以外での応答速度は測定されておらず、英語を含む各言語のAPI性能を保証する値でもない。測定元のAgoraは音声通信サービスを提供する企業でもある。測定方法と制約
OpenRouterの数値も、その経路で観測されたLatencyの集計だ。日本からの直接API呼び出しで、文章送信から最初の音が聞こえるまで必ず2.66秒や3.47秒かかる、という意味ではない。音声の長さやストリーミングの条件をそろえた比較としては使えず、日本語の初動の優劣は未確認だ。
会話のレスポンスを優先する場合、GPT-Liveの会話全体と、Flash-Lite TTSを発話部分に使う構成を先に試すのが現時点の選び方になる。これは速度の実測順位ではなく、全二重会話と低遅延向けTTSという製品の役割からの判断だ。GoogleはLiteを低遅延・高処理量向けに位置づけ、両TTSでストリーミングを提供する。OpenAIの専用TTSもストリーミングに対応し、応答の速さを重視する場合はWAVまたはPCMを推奨している。Liteの位置づけ・Geminiのストリーミング・OpenAI TTSの出力形式
対応言語の数とその言語で自然に話せるかは別の情報
Googleの公称はFlashが130言語、Liteが101言語。両方の一覧には日本語、英語、中国語、広東語、韓国語、フランス語、ドイツ語、スペイン語、ポルトガル語、アラビア語、ヒンディー語、ベトナム語などが載る。言語や文字体系の区分も含むため、数だけで他社との品質差を判断することはできない。
| モデル | 公式資料で確認できる対応 | 自然さを判断する際の注意 |
|---|---|---|
| Gemini 3.8 Flash TTS | 公称130言語。日本語・英語などに加え、タイ語・フィンランド語・スウェーデン語も一覧に掲載 | 7言語の聴き比べ評価を下表で確認できる |
| Gemini 3.8 Flash-Lite TTS | 公称101言語。上記3言語は今回確認したLiteの一覧にはない | 対応する全言語の自然さを一括で保証する数字ではない |
| gpt-4o-mini-tts | 日本語・英語・中国語・韓国語・タイ語などの言語一覧を公開 | 声は英語向けに最適化されている |
| GPT-Live 1 | 言語を指示する方法は公開。網羅的な言語一覧や総数は確認したAPI資料に記載なし | 専用TTSの言語一覧をGPT-Liveに転用できない |
比較条件Flashの言語一覧・Liteの言語一覧・OpenAI TTSの言語一覧・GPT-Liveの言語指定を9月30日に確認。
声の設計とせりふごとの演出を一つの制作工程にまとめた
Flash TTSでは、自然言語で声の特徴を指定して新しい声を作り、同じ声を使いながらせりふごとの感情や話す速さを変えられる。2人の話者による台本、笑い声やため息、相づちの挿入にも対応する。たとえば、同じ登場人物が落ち着いて説明する場面と、驚いて声を上げる場面を作り分ける用途だ。Googleの発表
公式仕様では、Flash TTSを声の質感や演技、地域のアクセントに重点を置くモデル、Flash-Lite TTSを読み上げの大量処理や音声エージェントの発話部分に向くモデルと位置づける。対応言語はそれぞれ130言語と101言語で、日本語も含む。両者は同じAPIの形式を使うため、用途に応じて切り替えやすい。Flash TTSの仕様・Flash-Lite TTSの仕様
声の複製も利用できるが、本人の同意を録音して確認する手続きがある。発表には、既存の声の高さや音色を調整する「Voice remixing」も登場するものの、こちらは今後提供予定とされている。現時点で使える機能と混同しないようにしたい。提供機能と今後の予定
日本語の音声評価ではOpenAIの読み上げ専用モデルを上回った
Googleは、Hume AIとVoice Arenaによる評価結果を公開した。Hume AIは自然さや表現力など複数の観点で音声を評価する。Voice Arenaは、モデル名を隠して2つの音声を聴き比べる投票からEloレーティングを算出する。Googleの評価方法の説明では、Geminiは製品版のチェックポイント、標準の生成設定、1回の生成結果を使っている。評価方法と結果
| 指標または言語 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | OpenAI gpt-4o-mini-tts |
|---|---|---|---|
| Hume AIの総合品質指数 | 0.920 | 0.914 | 0.740 |
| Voice Arena 日本語 | 1232 | 1152 | 975 |
| Voice Arena 英語 | 1061 | 1087 | 940 |
| ブラジルポルトガル語 | 1104 | 1134 | 946 |
| ベトナム語 | 1135 | 1156 | 839 |
| 現代標準アラビア語 | 1204 | 1181 | 911 |
| ヒンディー語 | 1106 | 1076 | 843 |
| メキシコスペイン語 | 1152 | 1146 | 880 |
比較条件2026年9月時点のGoogle公開資料に掲載された第三者評価。言語別の行はVoice ArenaのEloで、高いほど聴き比べで好まれた。自然さだけを分離した点数ではなく、発音や声の好みも影響しうる。Hume AIの指数とは尺度が異なり、言語間の点数も直接比較しない。GPT-Liveは評価対象に含まれていない。
この結果だけではGPT-Liveとの音質の優劣は決まらない
日本語ではFlash TTSがFlash-Lite TTSとgpt-4o-mini-ttsを上回る。一方、英語ではLiteがFlashを上回っており、価格の高いモデルがすべての条件で首位になるわけではない。Eloは聴き比べの好みを表す指標なので、1232対975を「日本語能力が約26%高い」と解釈することもできない。
この7言語では、Flashは日本語・現代標準アラビア語・ヒンディー語・メキシコスペイン語、Liteは英語・ブラジルポルトガル語・ベトナム語で相手の得点を上回る。ただし、中国語や韓国語、フランス語などはこの公表表にない。対応していることは確認できても、自然さの順位までは分からない。
ここでOpenAIの比較対象になっているのはgpt-4o-mini-ttsであり、GPT-Live 1ではない。確認した資料には、Gemini 3.8 TTSとGPT-Liveを同じ条件で採点した結果や、両者の応答遅延を並べた実測値はない。掲載表からGPT-Liveへの勝敗や、何倍速いかは判断できない。
また、掲載図ではモデルごとの投票数や信頼区間、OpenAI側の詳細なモデル版までは分からない。Hume AI自身も、自然さ、表現力、声の一貫性、信頼性は別々に評価する必要があると説明している。日本語のナレーションを選ぶ材料にはなるが、固有名詞の読みや長い原稿の安定性まで保証する数字ではない。Hume AIの評価の考え方
GPT-Liveは相手の発話を聞きながら会話を続ける
GPT-Live 1は、話しながら同時に聞ける音声会話モデルだ。利用者が途中で補足したり言い直したりする対話を扱い、推論やツール実行は別のモデルやエージェントに任せられる。音声案内だけでなく、その場で予約条件を変えたり、調べものを待ちながら会話を続けたりする用途に向く。
Gemini TTSは、与えた文章を音声にする部分を担当する。ストリーミングで生成途中から再生できるが、相手の音声を理解して返答を考える機能まで含むわけではない。会話アプリに組み込むなら、音声認識、返答の生成、割り込み時に再生を止める処理などを別途組み合わせる。Gemini TTSの音声生成ガイド
| 比較する点 | Gemini 3.8 TTS | GPT-Live 1 |
|---|---|---|
| 中心となる仕事 | 文章から音声を生成 | 音声による双方向の会話 |
| 声の制御 | 声の設計と台本の演出 | 会話スタイルを指示 |
| 相手が話し始めたとき | アプリ側で認識・再生停止などを構成 | 聞くことと話すことを同時に扱う |
| 推論や外部ツール | 別のモデルや処理を組み合わせる | バックエンドのエージェントへ委任 |
比較条件Googleの仕様とOpenAIのGPT-Liveガイドに基づく機能比較。音声品質や遅延の実測順位を示すものではない。
原稿の読み上げを比べるならgpt-4o-mini-ttsも候補になる
ChatGPTを提供するOpenAIには、GPT-Liveとは別に読み上げ専用のAPIがある。Text to speechガイドが案内するgpt-4o-mini-ttsは、文章と声を指定して音声を生成し、話す速さ、感情、抑揚、ささやき声などを指示できる。ストリーミングにも対応する。声は英語向けに最適化されているため、日本語で採用する際は自分の原稿で確かめたい。
1回の入力上限も異なる。gpt-4o-mini-ttsは2,000トークン、Gemini 3.8 TTSは8,192トークンだ。Googleの開発者向け仕様に記載された音声出力の提供上限は16,384トークンで、25トークン毎秒として計算すると約10.9分になる。長い本を音声化するなら、原稿を分け、つなぎ目で声や音量が変わらないかを確認する工程が必要になる。OpenAIのモデル仕様・Geminiのモデル仕様・音声トークンの換算
Flash TTSの音声出力は現行料金で1分0.0135ドル
Gemini Developer APIのStandard有料枠では、Flash TTSの音声出力は100万トークンあたり9ドル、Flash-Lite TTSは6ドル。音声は1秒25トークンとして課金されるため、1分は1,500トークンになる。以下はその条件で計算した音声出力だけの費用で、入力した原稿や指示の料金は別だ。公式料金表
| モデルと適用期間 | 入力文章 100万トークン | 音声出力 100万トークン | 音声出力 1分の計算値 |
|---|---|---|---|
| Flash TTS 2026年12月31日まで | $0.50 | $9 | $0.0135 |
| Flash-Lite TTS 2026年12月31日まで | $0.50 | $6 | $0.009 |
| Flash TTS 2027年1月1日から | $1 | $18 | $0.027 |
| Flash-Lite TTS 2027年1月1日から | $1 | $12 | $0.018 |
比較条件Gemini Developer API料金表を9月30日に確認。米ドル建てのStandard料金。無料枠、Batch・Flex・Priority、キャッシュは含めない。1分の計算式は音声単価 × 25 × 60 ÷ 1,000,000。
OpenAIの専用TTSは入力0.60ドルと音声出力12ドル
gpt-4o-mini-ttsの公式仕様では、100万トークンあたり入力文章が0.60ドル、音声出力が12ドルとなる。仮に入力10万トークン、音声出力100万トークンを使えば、0.06ドルと12ドルを足して12.06ドルだ。
ただし、これは生成時間をそろえた比較ではない。事業者ごとに音声のトークン化の方法が違うため、Googleの「1秒25トークン」をOpenAIにも流用することはできない。今回確認したOpenAIの料金・モデルページには同じ条件の毎分換算が掲載されていないため、gpt-4o-mini-ttsを一律の分単価に置き換えていない。読み上げ費用を厳密に比べるには、同じ原稿で生成した音声の長さと実際の使用量を測る必要がある。
GPT-Liveの1分は音声の長さではなく接続している時間
GPT-Live 1は、音声セッション1分あたり0.05ドルで、秒単位で課金される。OpenAIの費用ガイドによると、利用者が話す時間、AIが話す時間、双方が黙っている時間、バックエンドの処理待ちを含む。マイクをミュートしてもセッションを閉じなければ終了しない。推論モデルやツールの利用料も別にかかる。
たとえば10分の会話でAIが計3分話したと仮定する。GPT-Liveのセッション料は0.50ドル。一方、現行のGemini TTSで3分の音声を生成する出力料は、Flashが0.0405ドル、Liteが0.027ドルになる。ただし後者には、相手の発話の認識、返答を考えるモデル、入力文章、会話を制御する仕組みの費用が入っていない。この差額をそのまま会話アプリの節約額として扱うことはできない。
量が増えると料金変更の影響も大きい。生成音声1,000分の出力料は、2026年中ならFlashで13.50ドル、Liteで9ドル。2027年からはそれぞれ27ドルと18ドルになる。GPT-Liveはセッション1,000分で50ドルにバックエンド費用を加える。予算では、生成音声の分数と会話の接続分数を別々に集計する必要がある。
会話の待ち時間を先に測り音声品質と費用を合わせて選ぶ
日本語のナレーションや登場人物のせりふを作るなら、今回の公開評価と演出機能から、Flash TTSを最初に試す理由がある。大量の定型文や案内を生成するなら、出力単価の低いFlash-Lite TTSと同じ原稿で聴き比べ、品質の差が用途に影響するかを見たい。OpenAIの環境で読み上げを追加する場合は、gpt-4o-mini-ttsも同じ比較に入る。
レスポンス重視なら、同じ日本語の短文と長文を使い、最初の音、答えの開始、割り込みから停止までを計測したい。中央値だけでなく、遅い側のP90も確認すると、ときどき長く待たされるモデルを見分けやすい。自分の端末と通信環境で必要な速さを満たした候補について、読み間違い、声の自然さ、やり直しを含む費用を比べる順番が実用的だ。
出典と参考資料
料金・仕様は2026年9月30日確認。評価の数値はGoogleが公開した2026年9月の資料に基づく。
- Gemini 3.8 TTSの発表 Google/9月23日
- Gemini 3.8 TTSの評価方法と結果 Google DeepMind/2026年9月
- Real World VoiceEQ Bench Hume AI
- Gemini 3.8 Flash TTSのモデル仕様 Google
- Gemini 3.8 Flash-Lite TTSのモデル仕様 Google
- Geminiの音声生成ガイド Google
- Gemini Developer APIの料金 Google
- GPT-Live 1のモデル仕様と料金 OpenAI
- 音声セッションの課金対象 OpenAI
- GPT-4o mini TTSのモデル仕様と料金 OpenAI
- Text to speechガイド OpenAI
- GPT-Liveの実機レスポンス測定 Agora/7月10日公開
- Flash TTSの配信経路別Latency OpenRouter/9月30日確認
- Flash-Lite TTSの配信経路別Latency OpenRouter/9月30日確認
- GPT-Liveのバックエンド遅延最適化 OpenAI
- GPT-Liveの言語と発音の指定 OpenAI