Gemini 3.8 Flash TTSとは?声を作れる新音声AI・Flash-Liteとの違い・使い方を整理
初回掲載日:
最終更新日:
この記事の結論
- Gemini 3.8 Flash TTSは、文章から音声を作るテキスト読み上げモデルです。
- 自然言語で声質やアクセント、演技を指定し、2人の会話や長時間音声も生成できます。
- Flashは声の設計と表現力、Flash-Liteは大量生成と効率を重視します。
- Gemini APIとGoogle AI Studioで案内されており、料金や利用枠はサービス・モデルごとに確認が必要です。
Gemini 3.8 Flash TTSとは?
Gemini 3.8 Flash TTSは、入力した文章を自然な音声へ変換するTTS(Text to Speech)モデルです。Googleは2026年9月23日の公式発表で、単に文章を読み上げるだけでなく、役割や声質、アクセントなどを自然言語で指定して、用途に合わせた声を設計できるモデルとして紹介しています。
リアルタイムの音声対話を主目的とするGemini Liveとは異なり、台本や文章からナレーション、会話、音声コンテンツを生成する用途が中心です。
Flash TTSとFlash-Lite TTSの違い
同時に発表されたFlash-Lite TTSは、音声を大量に生成する処理やコスト効率を重視したモデルです。用途に応じて選ぶと分かりやすくなります。
| 項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 向いている用途 | ナレーション、オーディオブック、複数話者の表現 | 大量の読み上げ、音声エージェント、反復生成 |
| 重視する点 | 声の忠実度、演技の細かさ、方言や発音 | スループット、低遅延、コスト効率 |
| 対応言語 | 公式モデルページでは130言語 | 公式モデルページでは101言語 |
| 主な提供先 | Gemini API、Google AI Studio、Gemini Notebook | Gemini API、Google AI Studio、Google Vids |
提供先や利用条件はサービスごとに異なり、すべての機能が同時に使えるとは限りません。実際に利用するときは、モデルページと各サービスの表示を確認してください。

自然言語で声をデザインできる
Flash TTSでは、声の役割、アクセント、声質、話す速さ、感情などを指示できます。たとえば「落ち着いたドキュメンタリー調」「明るくテンポのよい案内役」のように、台本と演技指示を組み合わせて音声を作る考え方です。
Googleの発表では、2,000以上のproduction-ready voicesも案内されています。あらかじめ用意された声を選ぶだけでなく、作品やサービスに合う声の方向性を指定できる点が特徴です。
感情・演技・2人の会話にも対応
行ごとに感情やペース、アクセント、方言の変化などを指定できます。笑い、ため息、驚きの息づかい、相づちのような非言語表現も公式発表で説明されています。
また、1つのスクリプトから2人の話者による会話を組み立てる機能も案内されています。Podcast、ゲームの会話、ドラマ風の音声などに応用できます。
長時間音声や日本語には対応する?
Googleは長時間生成について、声質や自然なペース、キャラクターの一貫性を保つことを目指すlong-form generationを説明しています。Podcastやオーディオブックのように、短い一言では終わらない音声制作に向く機能です。
対応言語はモデルによって異なります。公式モデルページではFlash TTSが130言語、Flash-Lite TTSが101言語と案内されています。日本語を含む利用可能言語や、特定サービスでの提供状況は、利用するモデルの最新ドキュメントで確認してください。
Voice Replicationは何ができる?
Voice Replicationは、約30秒の音声サンプルから一貫した声のプロフィールを作る機能です。自分のナレーションや、権利を持つ話者の音声をもとに、同じ声の方向性で文章を読ませる用途が想定されています。
ただし、誰の声でも自由にコピーできる機能ではありません。Googleは、参照音声を使う権利に加えて、音声所有者による同意録音(verbal consent recording)を求める同意確認を案内しています。本人の許可がない音声や、第三者になりすます目的で使うのは避けてください。

SynthIDやC2PAで生成音声を確認できる
GoogleはGemini Audioの生成音声に、耳で聞き分けるものではない検出用のSynthIDウォーターマークを付与すると説明しています。発表では、コンテンツの来歴を示すC2PA credentialsにも触れています。
これは、生成音声を人間が必ず判別できるという意味ではありません。公開や二次利用の際は、音声の出所、話者の同意、利用規約を別途確認してください。
どこで使える?
Googleの発表では、Flash TTSはGemini API、Google AI Studio、Gemini Notebookへの展開が案内されています。Flash-Lite TTSはGemini API、Google AI Studio、Google Vidsへの展開が案内されています。Gemini Enterpriseは発表時点でComing soonとされていました。
一般ユーザーが使う画面と、開発者がAPIから呼び出す場合では、モデル名・利用枠・利用できる設定が異なることがあります。まずはGoogle AI Studioで対象モデルが表示されるか、APIではモデルIDが利用可能かを確認してください。
API料金は?
Google AI for Developersの料金ページでは、2026年12月31日までのStandard料金として、Flash TTSは入力テキスト100万トークンあたり0.50ドル、出力音声100万トークンあたり9ドル、Flash-Lite TTSは入力0.50ドル、出力6ドルと案内されています。2027年1月1日以降は料金が変わる予定として掲載されています。
Batch、Flex、Priorityなど処理方法による料金区分もあります。音声トークンは毎秒25トークンと説明されているため、文字数だけで単純に費用を判断せず、最新の公式Pricingと利用量を確認してください。無料枠の有無や上限もアカウント・サービス条件によって異なるため、「完全無料」「無制限無料」とは考えないようにしましょう。
利用前に確認したいこと
- 使用するモデルがFlashかFlash-Liteかを確認する
- 日本語を含む対応言語と、使うサービスでの提供状況を確認する
- APIは最新料金と無料枠、出力トークン数を確認する
- Voice Replicationでは、話者の権利と同意を確認する
- YouTube、Podcast、アプリ、ゲームで使う場合は、各サービスの規約や契約条件を確認する
FAQ
Gemini 3.8 Flash TTSとは?
文章を音声に変換するGeminiのTTSモデルです。自然言語で声質や演技を指示し、ナレーションや会話音声を生成できます。
Flash-Lite TTSとの違いは?
Flashは声の設計や表現の細かさ、Flash-Liteは大量生成や効率を重視します。用途と料金を公式情報で比較して選びます。
日本語に対応していますか?
公式モデルページでは、Flash TTSは130言語、Flash-Lite TTSは101言語に対応すると案内されています。日本語を含む対応言語と提供条件は、利用するモデルの最新一覧で確認してください。
自分の声を再現できますか?
Voice Replicationで音声サンプルから声のプロフィールを作れます。ただし、権利と話者本人の同意確認が前提です。
無料で使えますか?
無料枠の有無と上限はサービス・アカウント条件で異なります。APIには有料の従量料金があるため、最新Pricingを確認してください。
生成音声に透かしはありますか?
Googleは生成音声に検出用のSynthIDを付与すると説明しています。耳で聞こえるロゴや字幕のような透かしとは異なります。
Google AI Studioで使えますか?
公式発表ではFlash TTS、Flash-Lite TTSともにGoogle AI Studioへの展開が案内されています。アカウントや提供時期によって表示が異なる可能性があります。
まとめ
Gemini 3.8 Flash TTSは、文章を読むだけでなく、声の役割や感情、アクセント、速度まで指示して音声を作れるモデルです。Flashは表現力や声の設計、Flash-Liteは大量生成と効率を重視するため、ナレーション、Podcast、ゲーム、音声エージェントなど目的に合わせて選べます。
Voice Replicationには同意確認が必要で、生成音声にはSynthIDが付与されます。料金、対応言語、利用サービス、商用利用の条件は変わる可能性があるため、実際に使う前にGoogle公式のモデルドキュメントとPricingを確認してください。