Gemini 3.8 TTSとは? 読むAIから「演じるAI」へ
Gemini 3.8 TTSは、入力した台本を音声として出力するText-to-Speechモデルだ。Googleは、表現や声の設計に重点を置くFlash TTSと、大量生成・低遅延・費用効率に重点を置くFlash-Lite TTSを発表した。音声を聞き取って会話するGemini Liveとは役割が違う。TTSは、読ませる文章を先に決め、発話の仕方を制御する用途に向く。[1] [2]
たとえば企業の説明動画で、同じ文章を「落ち着いた案内」から「緊迫した場面」へ変えたいとする。従来の固定ボイス選択だけでは声質を選べても、台詞単位で間、息遣い、話す速さを指定する作業は別になりやすかった。Googleの新モデルでは、声そのものを作り、その声に対して台詞ごとの話し方を指定できる。声の身元に相当する設定と、各行の演技指示を分けられる点が実務上の変化だ。[1] [2]
| 選択肢 | Googleが想定する主な用途 | 選ぶ前に確かめたいこと |
|---|---|---|
| Gemini 3.8 Flash TTS | キャラクター音声、朗読、演技を伴う作品 | 指示したニュアンスと長尺での一貫性 |
| Gemini 3.8 Flash-Lite TTS | 大量の吹き替え、音声案内、会話エージェントの読み上げ | 待ち時間、同時処理、費用と品質の釣り合い |
| Gemini 3.8 Live | 音声を入力するリアルタイムの双方向会話 | 聞き取り、割り込み、応答まで含む会話品質 |
「Gemini 3.8 Flash」と「Gemini 3.8 Flash TTS」も別モデルである。一般の文章生成モデルの料金や機能表を、音声合成へそのまま当てはめてはいけない。Googleのモデル一覧では、TTSの入力はテキスト、出力は音声と明記されている。[3]
音声生成ツール全体の選び方はAI音声生成ツール比較記事で扱う。本稿はGemini 3.8 TTS固有の仕様と判断条件に絞る。
何が新しい? 音声設計、行ごとの演技、長尺の一貫性
新モデルの特徴は「30種類の既成ボイスが増えた」という話ではない。Googleは、自然言語で人物像・アクセント・声の特徴を記述して独自の声を作るVoice design、既成の拡張ライブラリ、本人の音声を基にするVoice replicationを分けて提供する。発表では100以上の言語・方言と2,000種類以上の音声に言及するが、モデル一覧はFlash TTSを130言語、Flash-Lite TTSを101言語と別々に記す。対応言語数の表現が違うため、導入時は目的の言語・地域・モデルの組み合わせを個別に確認したい。[1] [4]
APIでは、読み上げる文章そのものをinputに置き、話し方の持続的な指定をspeech_metadata.style、使用する声をspeech_configに置く。咳やため息のような一時的な発声は<cough>や<sigh>などのタグで台本中に指定する。複数人の会話では|mhm|のような相づちも扱う。Googleは3.8系で入力を「そのまま読ませる台本」として扱い、以前のプレビュー版のように長い演出文を本文へ混ぜないよう案内している。[2]
ここで大切なのは、「声を固定する指示」を毎回長文で書くほど安定するわけではないことだ。Googleのガイドは、長い人物設定を毎ターン繰り返すと声がぶれる場合があるため、まずVoice designで声を作り、同じvoice IDを再利用し、行ごとのstyleは短くするよう勧める。日本語台本でも、タグは英語で書く方が良いとされる。これは、プロンプトを盛るより、声・台本・演技の役割を分ける方が再現しやすいという運用上の示唆だ。[2]
長尺についてGoogleは、数時間のコンテンツでも音色とテンポを維持できると説明する。ただしAPIの1回の入力上限は8,192トークン、出力上限は16,384トークンとモデルページにある。「数時間をワンショットで生成できる」とは読めない。長い作品は台本を区切り、同じ声IDを使い、つなぎ目と固有名詞を通しで確認する制作工程が必要になる。モデルカードにはより大きい出力上限も記されているが、APIの提供上限としてはモデルページの数値を優先する。[3] [5]

「世界1位」は何を測った数字か?
Googleは、Hume AIの音声設計評価でFlash TTSが総合71.4%、アクセント評価60.8%で首位と紹介した。また、Voice Arenaのブラインド選好評価で、日本語を含む複数言語で首位と発表している。ただしすべての声・台本・目的で最良という意味ではない。評価項目、比較したモデル、収録された言語と時期を確認する必要がある。[1]
Hume AI自身が2026年9月24日に公表した検証では、表現力と信頼性を合わせた指標でFlash TTSが0.920、Flash-Lite TTSが0.914で1位と2位だった。長尺の安定性も前世代より改善した。一方、「本人の声に似ているか」ではFlash TTSは13モデル中11位、Flash-Lite TTSは7位だった。人間らしい音声と、狙った本人の声への近さは違う。Humeは若年成人の声の指定や音量制御にも弱さを報告している。[6]
Humeの評価は、各音声をモデル名が分からない状態で3人の評価者が聴いたと説明される。テスト用の台本を開発側に渡していないとも記す。同時に、HumeはGoogleとの非独占的なライセンス契約があることを開示している。これらを合わせて読むと、公開ベンチマークは有益な比較の出発点だが、編集部や企業が使う日本語台本での採用試験を省く根拠にはならない。[6]
料金はいくら? 10秒の数字を1時間に直す
Gemini APIの標準有料枠では、2026年12月31日までFlash TTSの入力テキストが100万トークン当たり0.50ドル、音声出力が同9ドル。Flash-Lite TTSは入力が同0.50ドル、出力が同6ドルだ。2027年1月1日から公表価格はそれぞれ入力1ドル、出力18ドル・12ドルに変わる。Googleは無料枠も表示しているが、利用量の制限があるため、本番の大規模運用を無料で賄えるという意味ではない。[7]
| 2026年末までの標準有料枠 | Flash TTS | Flash-Lite TTS |
|---|---|---|
| 入力テキスト100万トークン | 0.50ドル | 0.50ドル |
| 出力音声100万トークン | 9ドル | 6ドル |
| 出力10秒の換算値 | 約0.00225ドル | 約0.0015ドル |
| 出力1時間の換算値 | 約0.81ドル | 約0.54ドル |
最後の1時間分は、Googleが示す音声1秒=25トークンという換算を使った編集部の計算だ。3,600秒なら9万音声トークンとなり、Flash TTSでは9万÷100万×9ドル=0.81ドル。ここに入力テキスト料金、再生成、保存、配信などは含めていない。2027年の公表単価では音声出力分だけでも2倍になる。大量生成の予算を組むなら、成功した完成尺だけでなく、読み間違いの差し替えや比較用の試作回数も計上したい。[7]
なお、Gemini APIとGoogle CloudのGemini Enterprise API、従来のCloud Text-to-Speech APIを同じ商品として価格比較してはいけない。Cloud Text-to-Speechの資料は、3.8 TTSモデルを同APIからは利用できず、Gemini Enterprise APIのプレビューとして扱うと明記する。使う窓口の料金表と提供状況を確認する。[8]
日本語でどう試す? 同じ台本で比較する手順
まずGoogle AI Studioで、同じ日本語台本をFlash TTSとFlash-Lite TTSに読ませる。Googleの発表では両モデルがAI StudioとGemini APIで順次利用可能とされ、API資料にはモデルIDgemini-3.8-flash-ttsとgemini-3.8-flash-lite-ttsが示されている。実際に選べるモデルや上限は利用画面で確認する。[1] [2]
- 声を固定する。 最初は同じ既成ボイスを選び、別の声質による印象差を減らす。日本語の地名、人名、数字、アルファベットの製品名、句読点を含む100〜200字の台本を用意する。
- 演技指定なしで生成する。 読み間違い、声の自然さ、速度、文末の処理を記録する。次に短いstyle指定を一つだけ加え、狙った変化と副作用を確認する。[2]
- 長文と対話を別々に試す。 同じ声IDで複数回に分けた朗読、2人の短い掛け合いを生成し、声色のぶれ、相づち、切り替わり、つなぎ目を聴く。
- 人がブラインドで評価する。 モデル名を伏せ、読みの正確さ、意図した演技、聞き疲れ、本人への類似性を別項目で採点する。各モデルで複数回作り、偶然よくできた1本だけを比べない。
- 制作費を完成尺で割る。 APIの利用量と再生成回数を記録し、完成した1分当たりの費用と作業時間を比較する。
この手順は編集部による評価案であり、本稿で音声を生成して優劣を実測した結果ではない。アナウンス用途なら読みの正確さ、ドラマなら演技、本人の代役なら声の近さを重くする。一つの「総合点」で用途の違いを消さないことが、第三者ベンチマークを実務へ移すときの要点になる。
声の複製は30秒で十分か? 同意と品質は別問題
Googleの発表は、本人または利用許諾を得た声の短いサンプルから声を再現できると説明する。開発者資料では、参照音声は成人本人の清潔な10〜30秒の音声、これとは別に、同じ本人が所定の文を読み上げた同意録音が必要だ。日本語の同意文も用意されている。声の持ち主を証明する手続きと、誰が何に利用してよいかを定める契約上の許諾は、両方確認する必要がある。[1] [9]
保存するカスタム音声は、設計した声と複製した声を合わせて1プロジェクト200件、保存期間1年。保存しないvoicekeyは7日とされる。長期シリーズやブランド音声では、IDの期限と更新時の再承認を制作計画へ入れる必要がある。Googleは生成音声にSynthIDの電子透かしを埋め込むとも説明するが、透かしは利用許諾や視聴者への説明の代わりにはならない。[2] [9] [1]
技術的にも、30秒の素材があれば本人と区別できない声を作れるという意味ではない。Humeの同一話者評価では、Gemini 3.8の複製音声は自然さより本人への類似性で弱かった。声優の追加収録、企業代表者のコメント、家族向けの音声保存など、本人性が重要な用途では、本人と権利者が完成音声を試聴し、公開範囲と撤回・更新方法まで決めるべきだ。[6]
導入時の落とし穴は? APIの制限を台本制作に戻す
Gemini 3.8 TTSは、文字入力から音声を出すためのモデルで、音声入力を聞いて答える機能はない。TTSガイドによると、1回のリクエストで2話者の音声を作る機能は既成ボイスで最大2人まで。独自設計や複製した声を使って複数人物の会話を作るときは、話者ごとに合成して音声をつなぐ。単発応答はWAV、ストリーミングではヘッダーのない24kHz・16bitのPCM片が既定のため、保存・連結方法も異なる。[2]
この制約は「2人以上の物語を作れない」という意味ではない。台本を分けて制作できるが、発話の重なりや呼吸、話者の切り替わりを後工程で確認する必要があるということだ。また、モデルカードは一般的な生成AIの限界に加え、遅延やタイムアウトが起こり得ると記す。APIを顧客向けの音声案内へ組み込むなら、失敗時の再試行、代替音声、待ち時間の計測を設計に含めたい。[2] [5]
用途ごとの判断は次のようになる。
| 目的 | 最初に試すモデル | 採用前の停止条件 |
|---|---|---|
| キャラクターの台詞・朗読 | Flash TTS | 固有名詞の読み、長尺での声の変化、演技指示の再現 |
| 大量の説明動画・案内 | Flash-Lite TTS | 必要な待ち時間を満たさない、修正回数を含む費用が合わない |
| 本人の声の再現 | 両モデルを同じ素材で比較 | 明確な許諾がない、本人が完成音声を承認しない |
| 利用者の声を聞く会話 | Gemini Live系を検討 | TTSを音声対話モデルと誤認している |
よくある質問
Gemini 3.8 TTSは無料で使える?
Google AI StudioやGemini APIの料金表には無料枠がある。ただし利用制限があり、無料枠の入力・出力がGoogleの製品改善に使われる条件も料金表に記される。機密台本や商用アプリの検証では、プランのデータ利用条件を確認してから投入したい。[7]
日本語も対応する?
Googleは日本語でのVoice Arena評価を紹介し、モデル一覧でも多言語対応を示す。ただし、対応していることと、日本語固有名詞・数字・方言を正確に読めることは別だ。上記の固定台本で対象用途を試すのが確実である。[1] [4]
NotebookLMやGoogle Vidsでも同じ機能を使える?
Googleの発表が明記する提供先は、Flash TTSがGemini Notebook、Flash-Lite TTSがGoogle Vidsだ。記事の「Gemini Notebook」を別製品名のNotebookLMと読み替えたり、APIのVoice design・複製機能が各アプリにすべて実装済みと考えたりしない。アプリの利用可能な操作はそれぞれの画面で確認する。[1]
まとめ
- 進化の中心は、声を選ぶだけでなく、声の設計と台詞ごとの演技を分けて扱えること。 キャラクター制作や長尺音声の作業方法が変わる。
- 評価の首位と、目的の声に似ることは別。 Humeの評価では表現力と長尺の安定性が強い一方、声の複製では本人への類似性が課題に残った。
- 採用判断は日本語台本での試作から。 料金の年末変更、APIの話者・入出力制限、本人の同意と人による確認まで含めて、完成尺当たりの品質と費用を比べる。
出典・参考
- Google Japan Blog「Gemini 3.8 音声合成モデルを発表」(2026年9月23日)
- Google AI for Developers「Text-to-speech generation (TTS)」(2026年10月8日確認)
- Google AI for Developers「Gemini 3.8 Flash TTS」モデル仕様(2026年10月8日確認)
- Google AI for Developers「Models」音声モデル一覧(2026年10月8日確認)
- Google DeepMind「Gemini 3.8 Audio」モデルカード(2026年9月公開)
- Hume AI「Newly-released Google's Gemini 3.8 Flash TTS tops Hume's Real-World VoiceEQ leaderboard」(2026年9月24日)
- Google AI for Developers「Gemini Developer API pricing」(2026年10月8日確認)
- Google Cloud「Gemini-TTS」(2026年10月8日確認)
- Google AI for Developers「Voice replication」(2026年10月8日確認)






