Gemini Speech Generationの料金とは?TTS導入コスト・費用対効果・Live APIとの違いを解説【2026年版】

Gemini Speech Generationの料金とは?TTS導入コスト・費用対効果・Live APIとの違いを解説【2026年版】

Gemini Speech Generationの料金は、見出しだけ見ると『音声AIは高そう』と感じやすいです。ですが、Googleの公式Pricingを見ると、固定原稿を読み上げるTTSと、双方向会話を前提にしたLive APIでは課金の伸び方がかなり違います。PoCで重要なのは、単価そのものよりも『何秒の音声を何本作るか』『会話なのか、読み上げなのか』を先に切り分けることです。この記事では、2026年5月時点の公式情報をもとに、Gemini 3.1 Flash TTS Preview、Gemini 2.5 Flash Preview TTS、Gemini 2.5 Pro Preview TTS、Live API系の違いを実務目線で整理します。

結論を先に言うと、台本が決まっているナレーションや教材音声ならTTSのほうが安く、かつ設計が簡単です。逆に、割り込みや聞き返しを含む音声エージェントを作りたいなら、最初からLive API前提で見積もったほうが手戻りを減らせます。

Gemini Speech Generationは何にお金がかかるのか?

Google公式Pricingでは、Speech Generation系は主に入力テキストと出力音声で課金されます。特に重要なのが、音声は1秒あたり25トークン換算で計算される点です。つまり費用は『何文字読ませるか』より『最終的に何秒の音声が出るか』で膨らみやすいです。社内FAQの短い案内音声を大量生成するのか、10分超の教材を少数生成するのかで、同じTTSでもコスト感は大きく変わります。

2026年5月時点の公式料金:まず見るべき4モデル

固定原稿向けのGemini 3.1 Flash TTS Previewは、入力1M text tokensあたり1.00ドル、出力1M audio tokensあたり20.00ドルです。より価格重視のGemini 2.5 Flash Preview TTSは、入力0.50ドル、出力10.00ドルで、PoCの最初の比較対象にしやすい水準です。品質寄りのGemini 2.5 Pro Preview TTSは、入力1.00ドル、出力20.00ドルで、3.1 Flash TTSと近いレンジにあります。

一方、会話前提のLive API系では、Gemini 3.1 Flash Live Previewが音声入力3.00ドル/1M tokens、音声出力12.00ドル/1M tokens、Gemini 2.5 Flash Native Audioが音声入力3.00ドル/1M tokens、音声出力12.00ドル/1M tokensです。Live系は一見するとTTSより出力単価が低く見えますが、実際には音声入力や継続セッションの設計も乗るため、単純な読み上げ用途ではTTSのほうが総コストを読みやすいケースが多いです。

TTS導入の費用対効果はどう見る?90秒と10分で試算

公式の25 tokens/秒換算で考えると、90秒の音声は2,250 audio tokens、10分の音声は15,000 audio tokensです。Gemini 2.5 Flash Preview TTSなら、90秒音声の出力コストは約0.0225ドル、10分音声でも約0.15ドルです。Gemini 3.1 Flash TTS Previewでも、90秒で約0.045ドル、10分で約0.30ドルに収まります。原稿の入力テキスト課金は多くの業務用途では相対的に小さいため、PoCではまず『再生成率を何%まで許容するか』のほうが費用差を生みます。

例えば、1本90秒のFAQ音声を100本作るなら、2.5 Flash Preview TTSの音声出力だけで約2.25ドル、3.1 Flash TTS Previewでも約4.50ドルです。これなら、運用チームが人手で収録・差し替えしていた工数と比べて、十分にPoCしやすい価格帯です。逆に、長尺の研修動画を何度も再生成する運用にすると、品質確認や台本修正の工数も含めてROIが崩れやすいので、章分割前提で設計したほうが安全です。

Live APIとの違い:安いかどうかではなく用途で分ける

GoogleのSpeech generationガイドでは、TTSはexact text recitation、つまり決まった文章を狙ったトーンで正確に読ませる用途に向くと説明されています。対してLive APIは、interactiveでunstructuredな音声・マルチモーダル入出力向けです。問い合わせ受付、音声秘書、リアルタイム案内のようにユーザー発話で分岐するならLive APIが自然ですが、ナレーション、eラーニング、動画読み上げ、社内アナウンスならTTSのほうが実装も見積もりもシンプルです。

見落としやすい制約:32kコンテキスト、非ストリーミング、長尺ドリフト

公式のSpeech generationページでは、TTSモデルはtext input only / audio output only、セッションのcontext windowは32k tokens、そしてstreaming非対応と明記されています。さらにGemini 3.1 Flash TTS Previewでは、数分を超える長い出力で品質や一貫性が揺らぐ場合があり、トーン指示と選んだ声の相性が悪いと期待した話者像からずれることもあります。実務では、5〜10分超の原稿を一括で投げるより、章ごと・シーンごとに分けて生成し、差し替え可能な運用にしておくほうが安定します。

どのチームが向いている?導入判断の目安

向いているのは、サポート、カスタマーサクセス、研修、マーケティング、プロダクト教育のチームです。共通するのは『同じ説明を繰り返す原稿があり、更新頻度もそこそこ高い』ことです。反対に、会話の自然さや聞き返し耐性が重要なコールフロー、あるいはユーザーの発話内容に応じて返答が大きく分岐する業務は、最初からLive API評価に寄せたほうがよいでしょう。読み上げか会話かを曖昧にしたままPoCを始めると、費用見積もりもUX評価もぶれやすくなります。

よくある質問

Q. まず試すならどのモデルが無難ですか? A. 価格重視ならGemini 2.5 Flash Preview TTS、品質と指示追従を少し強めたいならGemini 3.1 Flash TTS Previewか2.5 Pro Preview TTSから比較すると整理しやすいです。Q. Live APIのほうが音声出力単価が低いなら、そちらで統一すべきですか? A. いいえ。固定原稿用途では、音声入力や双方向設計まで抱えるぶん、かえって実装負荷が増えることがあります。Q. 何から試算すべきですか? A. 1本あたりの秒数、月間本数、再生成率、レビュー工数の4つです。

Geminiの音声AI導入で、TTSとLive APIのどちらから始めるべきか迷う場合は、費用試算だけでなく、台本設計・再生成フロー・運用ルールまで一緒に決めたほうが失敗しにくいです。 AI・Claude研修のご相談はこちら 。音声AIのPoC設計、生成AIの社内展開、部門別の活用研修までまとめて支援できます。