Gemini 3.1 Flash TTS(Preview)は、Google Gemini APIで提供されるテキスト音声化モデルです。2026年7月現在、単一話者・複数話者の会話音声生成、スタイル制御(トーン・話速・感情表現)に対応し、固定原稿のナレーション、e-learning教材、IVR案内、営業資料音声など、テキストベースのナレーション配信に適しています。ただし Preview 段階であり、仕様やレート制限が予告なく変更される可能性、また Gemini 2.5 Flash TTS など新モデルの登場も報告されているため、production 導入前に最新モデルラインアップの確認が必須です。
Gemini 3.1 Flash TTSとは?Preview段階の位置付けと現在の提供状況
Gemini 3.1 Flash TTS は、2026年4月15日にPreviewとして公開されたテキスト音声化(TTS)モデルです。Google AI for Developers公式サイトの Speech Generation セクションに gemini-3.1-flash-tts-preview として記載されており、テキスト入力から自然な音声出力を低遅延で生成することが仕様の中心。
Preview段階であることから以下が当てはまります:(1) API仕様・レート制限が予告なく変更される可能性。(2) モデルラインアップ自体が流動的で、Gemini 2.5 Flash TTS Preview など新バージョンの登場により、3.1 が deprecated または限定的な用途に移行する可能性。(3) Preview モデルは本番環境での SLA(Service Level Agreement)保証がない場合が多く、信頼性実績が限定的。
Production環境での採用前に、公式モデルページで最新の availability と推奨モデルを確認することが必須。特に大規模な音声配信サービスを計画している場合は、Google Cloud Support に Preview の stable・GA 移行予定を事前に問い合わせておくと、後の移行リスクを減らせます。
機能:単一話者・複数話者、スタイル制御、長尺テキスト対応の実際
公式ドキュメントでは、Gemini 3.1 Flash TTS が以下のモードに対応していることが示されています。
- Single-speaker TTS:1人のナレーターが全文を読む。AI Studio で試す場合、Voice Library から 20+ の音声キャラクターが選べ、性別・年齢・アクセント・話速をプリセットで選択可能。
- Multi-speaker TTS:複数キャラの会話を1つのテキストで定義。XML または JSON 形式で各キャラの台詞と話者指定を記述し、一括生成。ポッドキャスト対談形式、FAQ Q&A 音声、教材の登場人物会話に向いています。
- スタイル制御:自然言語指示(speak in a very calm and slow manner)、または audio tags(<audio>タグで speed、emotion、tone を指定)により、固定テキストの表現を細かく調整可能。
実装上の注意点としては、(1) 長尺テキスト(複数分~数十分の原稿)を一度に送信すると、音声品質が秒単位で揺らぐ可能性。公式では context window 32k tokens の制限があり、それ以上は truncate されます。(2) マルチスピーカーモードでも、各キャラの音声は別生成ではなく、TTS 内部で役割を切り替える仕組みのため、個別の voice customization には対応していません。
実運用では、長い原稿(例:30分のポッドキャスト脚本)を1章ずつ(5~10分単位)に分割して API call し、各出力を管理画面で review・adjust してから結合する設計が安定します。
料金観点:token 計算、PoCの費用試算、月額予算の立て方
Google Pricing ページの記載により(2026年7月時点)、Gemini 3.1 Flash TTS Preview の Paid Tier 料金は以下の通りです。
- 入力(テキストトークン):100万トークンあたり 1.00 ドル。
- 出力(音声トークン):100万トークンあたり 20.00 ドル。
- 音声トークン換算:1秒の音声 = 約 25 音声トークン。
PoC の費用試算例:営業資料用に 1分(60秒)の説明ナレーション音声を生成する場合、(1) テキスト原稿:約 150 tokens → 150 / 1M * $1.00 = $0.00015。(2) 音声出力:60秒 * 25 tokens/秒 = 1,500 tokens → 1,500 / 1M * $20.00 = $0.03。合計:約 $0.03 / 1回。月間 500 本の営業資料音声生成なら、$0.03 * 500 = $15/月 + 各モデルへの API call overhead。
注意点としては、再生成や試行錯誤(トーン調整、キャラ変更)の際は都度費用がかかること。また、音声トークンは出力秒数に完全に比例するわけではなく、アクセント・話速制御により秒数が変わるため、試算には 10~20% の buffer を見ておくことが安全です。
Realtime Voice / Live API との使い分け:双方向音声との違い
Google 公式では、TTS と Realtime Voice / Live API を明確に分けています。
Gemini 3.1 Flash TTS:「テキスト → 音声」の一方向変換。原稿が固定で、音声生成後は再編集・再配信の前提。API 応答は数秒~数十秒(原稿の長さ次第)。用途は、ナレーション配信、教材音声、定型案内、ポッドキャスト字幕から音声への変換。
Gemini Live API(Realtime Voice Preview):音声・テキスト・画像をストリーミング入力でき、低遅延(100~500ms)で双方向の会話を実現。ユーザーの発話をリアルタイムで解釈し、割り込み、ターンテイク、文脈に応じた即興応答が可能。料金も異なり、音声入力 3.00 ドル/100万トークン、音声出力 12.00 ドル/100万トークン。
使い分けの判断軸:「原稿は事前に用意できるか」が最大の分岐点です。固定テキスト → 音声が目的なら TTS。ユーザー発話の瞬間ごとに応答内容が変わる(IVR、カスタマーサービスボット、interactive 音声ゲーム)なら Live API。中間的には、「FAQ は TTS 化、但し顧客質問への個別返答は Live API」といった使い分けも可能です。
導入で向いている場面・向かない場面、事前 PoC チェックリスト
【向いている場面】営業資料・プレゼンテーション音声化:スライドテキスト → ナレーション動画生成。e-learning / 研修教材:テキスト教材の音声版作成、複数講師の会話形式シナリオ。カスタマーサポート初期対応:ナレッジベースの FAQ を音声化し、電話で自動案内。ポッドキャスト・オーディオコンテンツ配信:ブログ記事 → ポッドキャスト声素材への自動変換。多言語ローカライズ:翻訳後のテキストを各言語の自然な発音で音声化。
【向かない場面】実時間インタラクション:電話 IVR で顧客の言葉を待ちながら返答が必要な場合は Live API 向け。動的に内容が変わる応答:パラメータや文脈に応じて、毎回異なるテキストが生成される場合、TTS の事前準備では追い付かない。長尺ナレーション(30分超)の一括生成:context window と品質揺らぎの問題から、分割生成が必須となり運用複雑化。
PoC チェックリスト:(1) 原稿の長さと更新頻度を見積もったか(30分超は分割設計要)。(2) スタイル(トーン・話速)の調整が何度必要か(再生成コスト)。(3) マルチスピーカーモードで個別音声カスタマイズは不要か。(4) 月額予算に 20% buffer を見たか。(5) Preview モデルの不安定性に対する fallback 計画(別ベンダー TTS、人間ナレーション)は立ったか。
よくある判断軸
「まずは低コストで音声AI を試したい」なら、TTS で固定原稿のユースケースから始めるのが現実的です。「会話の自然さや割り込み応答が重要」なら、最初から Realtime Voice 寄りの Live API 評価に進んだほうが手戻りを減らせます。選定を迷う場合は、①原稿固定か、②双方向会話か、③1本あたりの秒数はどれくらいか、の3問で整理すると判断しやすくなります。
Gemini TTS(3.1 Flash、2.5、その他最新モデル)の選定、PoC 設計、production 移行の判断について、技術的な詳細や cost optimization を含めて相談したい場合は 無料相談はこちら 。現在利用中のモデルのリスク評価、最新モデルラインアップの整理、fallback 戦略の構築も support できます。