· CCO Vivienne クリエイティブ · 8 min read
Gemini 3.8 Flash TTSは声を「設計」し行ごとに演出——同意確認と透かしを、制作の品質ゲートに入れる
Google DeepMindは2026年9月23日、音声生成モデルGemini 3.8 Flash TTSとFlash-Lite TTSを公表しました。Flash TTSは自然言語で声を一から設計でき、両モデルで行ごとに演出できます。音声複製の同意確認とSynthIDの透かしを、クリエイティブ責任者の視点で読み解きます。
※ 本記事は2026年10月2日時点の公開情報に基づきます。仕様・提供状況は変化するため、最新情報は各社公式発表等をご参照ください。
Google DeepMindは2026年9月23日、Geminiファミリーの音声合成(TTS)モデル2つ、「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公表しました。Googleは両モデルを、これまでで最も表現力豊かな音声生成モデルと位置づけています(出典: Google DeepMind 公式ブログ)。
声を「選ぶ」から「設計する」へ
クリエイティブ責任者として注目したのは、声を一から作る機能です。Googleによると、Flash TTSでは役柄、アクセント、声の特徴を自然言語のプロンプトで指定し、100を超える言語・方言にわたって特注の声を作れます。ほかに2,000以上の声のライブラリがあり、設計した声は保存・管理して、継続するプロジェクトでも声のぶれを最小限にできるという説明です。声のリミックス(音色、ピッチ、ペース、アクセントの微調整)は「近日提供」で、公表時点では未提供です(出典: Google DeepMind 公式ブログ)。
私たちの読みでは、これは声がビジュアルアイデンティティの隣に座る入り口です。色と書体を定めるように、ブランドの声を定める。ただし導入成果の数字は、ブログにありません。
行ごとの演出——「何を言うか」より「どう言うか」
両モデルとも、1行ごとに話し方を演出できます。利用者がト書きを書くか、台本の自然なキューに沿ってGeminiが読み方を導く方式です。Flash TTSは演技の指示、ペース、方言の切り替え、相づちを細かく制御でき、Flash-Lite TTSは大量の吹き替え、音声コンテンツ制作、表現力のある音声エージェント向けに最適化され、トーン、ペース、表現のニュアンスを細かく制御できるとされています(出典: Google DeepMind 公式ブログ)。
品質の数字はGoogle自身の掲載です。Flash TTSはHume AIのVoice Design Benchmarkで総合1位(71.4)。Voice Arenaの盲検の人間選好評価では、両モデルが日本語を含む主要言語で競合の中で上位を占めたとあります。評価の条件や比較対象の詳細は本文にありません(出典: 同上)。
自由度が上がるほど、決め手は指示の言葉の精度だと私たちは見ています。ディテールが全体を決定します。
同意確認、SynthID、提供地域——品質ゲートに入れる項目
音声複製について、Googleは、自分の声または利用権を持つ声の30秒の音声サンプルから、一貫した声のプロファイルを再現できるとし、同意確認、SynthIDの透かし、C2PAクレデンシャルを内蔵するとしています。声の作成前には、声の持ち主による口頭の同意の録音で、参照話者と一致するものの提出が必須だと説明しています。さらに、Gemini Audioモデルが生成するすべての音声クリップにSynthIDの透かしが入り、AI生成音声が検出可能であり続けるとしています(出典: Google DeepMind 公式ブログ)。なおC2PAは音声複製の説明の中での言及で、全出力に付くかは読み取れません。
提供は公表日から順次です。両モデルとも開発者向けはGemini APIとGoogle AI Studioで、一般向けはFlash TTSがGemini Notebook、Flash-Lite TTSがGoogle Vidsです。企業向けは両モデルとも、Gemini Enterprise内のAPI経由で近日提供の予定です。AI Studio経由の音声複製は、イリノイ、テキサス、EEA、英国、スイス、インドでは利用できないと脚注にあります。日本は除外一覧にありませんが、日本での提供を明記した記述もありません(出典: 同上)。
品質ゲートとして見ると、声は画像や書体と同じく、出所と権利を確かめる素材です。審美の判断と並んで、誰の声に基づくのか、同意の記録は残っているかを確認します。
中小企業への翻訳——導入前に決める3つのこと
一般論として3つ挙げます。効果の保証ではありません。
声の出自を台帳に残す。 自社で設計した声か、持ち主の同意を得た複製か、ライブラリの声か。種類ごとに同意の記録を残します。
演出ノートを言語化する。 トーン、間、避ける話し方を文章で定義し、ブランドの声の基準にします。
公開前に提供地域と表示を確かめる。 透かしは検出用の仕組みです。聞き手への伝え方は、自社で決めます。
まとめ
- Google DeepMindは2026年9月23日、音声生成モデルGemini 3.8 Flash TTSとFlash-Lite TTSを公表。Flash TTSは自然言語のプロンプトで声を一から設計でき、2,000以上の声のライブラリも用意される
- 両モデルとも行ごとに話し方を演出できる。Flash TTSはHume AIのVoice Design Benchmarkで総合1位(71.4)とGoogleは書くが、評価の条件は本文にない
- 音声複製は自分の声または利用権を持つ声の30秒のサンプルから可能で、声の持ち主による口頭の同意の録音の提出が必須。Gemini Audioモデルが生成する全音声クリップにSynthIDの透かしが入る
- 提供は公表日から順次で、企業向けは近日提供の予定。AI Studio経由の音声複製はイリノイ、テキサス、EEA、英国、スイス、インドでは利用不可
自由度が上がるほど、仕上がりを守るのは確認の精度です。どの声を誰の同意で使うのか、どこで提供が制限されるのか。美しい声は、権利と出所が確かなところまで含めて美しい。ディテールが全体を決定するという原則は声にも当てはまると私たちは考えます。
※ 本記事は一般的な情報提供を目的としており、個別の法的・財務的・経営的助言ではありません。具体的な課題については専門家にご相談ください。