Gemini 3.8 TTSとは?声をデザインして演技まで指示できるGoogleの音声合成AI

コラム

文章を渡すと、人が話しているような音声にして返してくれる「音声合成(TTS)」。Googleが新しく出した「Gemini 3.8 TTS」は、この“読み上げ係”を、声づくりから演技指導までこなす“録音スタジオ”に近いものへ進化させました。言葉で説明するだけで新しい声を作れるほか、本人の同意があれば短い録音から声を再現でき、台本の1行ごとに「ささやくように」「笑いながら」といった演出も付けられます。高品質な「Flash TTS」と、速くて安い「Flash-Lite TTS」の2種類が用意され、日本語にも対応しています。この記事では、何ができるのか、料金はいくらか、仕事でどう使えるのかを、公式情報をもとに整理します。

なお、同じ「Gemini Audio」ファミリーで、会話しながら裏で作業を進める音声AIについては、Gemini 3.8 Liveの解説記事で紹介しています。

公式の紹介動画

Google DeepMindの公式YouTubeチャンネルでは、約1分の紹介動画「Create your own voices with Gemini 3.8 text-to-speech」が公開されています。言葉で声を注文して作る様子や、ボイスライブラリから声を選ぶ流れがイメージできます。

Gemini 3.8 TTSとは?「読み上げ係」から「声の制作スタジオ」へ

Gemini 3.8 TTSは、Googleが日本時間2026年9月24日(木)午前0時15分ごろに公式ブログで発表した、新しい音声合成モデルです。正式な名前は「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の2つで、Googleは「これまでで最も表現力のある音声生成モデル」と紹介しています。

これまでの音声合成は、用意された声の中から1つを選んで原稿を読ませる、いわば「決まった声優さんに読み上げを頼む」使い方が中心でした。今回のモデルは、声そのものを言葉で注文して作る、本人の声を再現する、セリフごとに感情や間(ま)を指示する、といった“制作の工程”までまとめて扱えるのが大きな違いです。公式ブログは「固定のプリセットから、ダイナミックな制作スタジオへ」と表現しています。

ひとつ注意したいのは、これは「文章を声にする」専用のモデルだという点です。人と会話する音声AIではなく、決まった原稿を正確に、表情豊かに読み上げる用途に向いています。リアルタイムでやり取りする音声アシスタントは、同じファミリーの「Gemini 3.8 Live」が担当します。

2つのモデルの違い

2つのモデルは同じ使い方(同じ注文書の書式)で動くため、用途に合わせて切り替えられます。料理に例えるなら、Flash TTSは「手間をかけて仕上げるコース料理」、Flash-Lite TTSは「大量に素早く出せる定食」のような関係です。

項目Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
モデルIDgemini-3.8-flash-ttsgemini-3.8-flash-lite-tts
得意なこと声の忠実さ、細かな演技、方言や地域なまりの表現大量処理、低遅延、コスト効率
向いている用途オーディオブック、本格ナレーション、複雑な2人の掛け合い、難しい読み方、方言大量の音声制作、音声エージェント、読み上げ機能、声の複製、日常的な1人読み
対応言語(公式ドキュメント)130言語101言語
位置づけ新しい最上位の制作向けモデル従来の「Gemini 3.1 Flash TTS Preview」の後継

前の世代にあたる「Gemini 3.1 Flash TTS Preview」や「Gemini 2.5 Flash/Pro Preview TTS」も、1人読みと2人の掛け合いには対応していました。ただし公式ドキュメントの比較表では、言葉で声を作る「ボイスデザイン」と、声を再現する「ボイスレプリケーション」に対応しているのは3.8の2モデルだけです。

声を「つくる・選ぶ・まねる」ボイス機能

今回いちばんの目玉は、声の選び方が一気に広がったことです。公式ブログでは「30種類のオリジナル音声から、無限のライブラリへ」と表現されています。具体的には次の4つの方法で声を用意できます。

  • 標準ボイス(30種類):「明るい」「親しみやすい」「温かい」など、性格づけされた定番の声
  • 拡張ボイスライブラリ:公式ブログやGoogle公式Xでは「2,000種類以上の、すぐ使える声」と紹介。地域ごとの言葉の違いもカバー
  • ボイスデザイン:「30代の女性、元気で力強く、ブルックリンなまり」のように言葉で説明するだけで、新しい声を作れる。作った声は保存して使い回せる
  • ボイスレプリケーション(声の複製):自分の声や、使う権利のある声を短い録音から再現する。公式ブログでは「30秒の音声サンプル」から、と説明

ボイスデザインは、いわば「声のオーダーメイド」です。キャスティング会議で「こんな雰囲気の人を」と注文するように、役柄・年齢・話し方・なまりを文章で伝えると、その声が出来上がります。会社の“声の顔”となるブランド用ボイスを決めておけば、動画や案内音声をいつも同じ声でそろえられます。

声の複製には、なりすましを防ぐための仕組みが組み込まれています。公式ドキュメントによると、再現したい人の録音(10〜30秒)に加えて、同じ人が「私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。」という同意文を読み上げた録音が必要です。この同意文には日本語版も用意されています。また、声のトーンや話す速さ、なまりを後から調整できる「ボイスリミックス」は「近日提供」とされています。

公式Xで公開された紹介動画

Googleの公式Xでは、ゲームのキャラクターに合わせて、言葉で注文しながら声を作っていくデモ動画が公開されています(日本時間9月24日午前0時25分ごろの投稿)。投稿本文には、ボイスデザイン、2人の掛け合い、笑い声やため息などの演出、30秒の録音からの声の再現、2,000種類以上の声、SynthIDによる透かしといった主な機能が一覧でまとめられています。

台本どおりに「演技」させる:1行ずつの演出と2人の掛け合い

声を決めたら、次は演技指導です。2つのモデルとも、セリフごとに話し方を細かく指示できます。舞台の台本でいえば、セリフの横に書く「ト書き」を付けられるイメージです。

  • セリフ単位の演出:「ささやくように、切迫して」「息を切らして」「温かく、熱意をこめて」など、その行全体の話し方を指定できる
  • その瞬間だけの音:笑い声、ため息、息をのむ音、せき、短い間などを、セリフの途中に差し込める
  • あいづち:聞き手役の「うんうん」「なるほど」といった反応を入れて、会話のリズムを自然にできる
  • 2人の掛け合い:1本の台本から、2人の声を区別したまま、自然な順番で会話させられる
  • 長時間の読み上げ:公式ブログでは、何時間もの連続音声でも声質やペースが崩れにくく、ポッドキャストやオーディオブックに向くと説明

実務で覚えておきたいのは、Gemini 3.8 TTSは渡した文章を「一字一句そのまま読む原稿」として扱う点です。公式の移行ガイドによると、本文に「明るく言って:」のような指示を書くと、その指示まで読み上げられてしまうことがあります。演出は本文とは別の欄に書くのが新しいルールです。今まで別のモデルで使っていた原稿をそのまま流用する場合は、この点だけ見直しておくと安心です。

なお、1回の依頼で掛け合いをさせられるのは2人までで、しかも標準ボイス同士の場合に限られます。自分で作った声や複製した声を複数登場させたいときは、セリフごとに別々に音声を作ってつなげる必要があります。

日本語への対応

日本語は、2つのモデルの対応言語にどちらも含まれています。入力した文章の言語は自動で判別されるため、言語を切り替える設定は基本的に不要です。

公式ブログによると、人が聞き比べて好みを選ぶ評価サイト「Voice Arena」で、Gemini 3.8 Flash TTSとFlash-Lite TTSは、日本語を含む主要言語(ブラジルポルトガル語、ベトナム語、標準アラビア語、メキシコスペイン語、ヒンディー語など)で上位を獲得したとしています。品質評価サービスHume AIの指標では、Flash TTSが声のデザインで総合1位(71.4)、なまりの再現でも首位(60.8)、全体的な品質の指標ではFlash TTSが1位、Flash-Lite TTSが2位とされています。いずれもGoogle自身の発表に基づく数字です。

公式ブログには、Flash TTSで「日本のドラゴン」の声を作る音声サンプルも掲載されています。ただし、日本語の自然さや読み間違いの少なさは、文章の内容や用途によって変わります。社名・人名・専門用語の読み方などは、導入前に自社の原稿で試しておくのがおすすめです。

料金:2026年末までは導入価格

開発者向けのGemini APIの料金は、文字(入力)と音声(出力)の量に応じた従量課金です。公式の料金ページでは、音声は「1秒あたり25トークン」と換算されています。標準の料金は次のとおりです(米ドル、100万トークンあたり)。

モデル入力(文字)出力(音声)公式の目安(音声10秒あたり)音声1時間あたり(記事での計算)
Gemini 3.8 Flash TTS(2026年12月31日まで)$0.50$9.00$0.00225約$0.81
Gemini 3.8 Flash TTS(2027年1月1日から)$1.00$18.00$0.0045約$1.62
Gemini 3.8 Flash-Lite TTS(2026年12月31日まで)$0.50$6.00$0.0015約$0.54
Gemini 3.8 Flash-Lite TTS(2027年1月1日から)$1.00$12.00$0.003約$1.08
(参考)Gemini 3.1 Flash TTS Preview$1.00$20.00—約$1.80

※「音声1時間あたり」は、公式の換算(1秒=25トークン)をもとに出力音声の料金だけを当記事で計算した目安です。入力した文字の料金は別にかかります。

ポイントは3つです。まず、2026年12月31日までは導入価格で、2027年1月1日からは料金がちょうど2倍になると明記されています。それでも2027年以降の音声出力の単価(Flash TTSで$18.00、Flash-Lite TTSで$12.00)は、従来の3.1 Flash TTS Preview($20.00)より低い設定です。GoogleのAI担当者ローガン・キルパトリック氏も、公式Xで「以前の3.1 Flash TTSより低コスト」と投稿しています。

次に、急ぎでない大量処理向けの「Batch」「Flex」では、上の標準料金の半額(2026年中のFlash TTSなら出力$4.50)になります。逆に優先的に処理してもらう「Priority」は割高(同$16.20)です。宅配便でいえば、通常便・まとめ割・速達便を選べるイメージです。

最後に、Gemini APIには無料枠(Free Tier)もあり、標準の入出力は無料で試せます。ただし公式の料金表では、無料枠で送ったデータは「Googleの製品改善に使われる」と記載されており、有料枠では使われません。社外秘の原稿を扱うなら有料枠を選ぶのが無難です。文字起こし側の料金と合わせて見積もりたい場合は、文字起こしAPI料金比較の記事も参考になります。

どこで使える?提供範囲

公式ブログやGoogle AI公式Xによると、提供先は次のとおりです。

  • 開発者向け:2モデルとも、Gemini APIとGoogle AI Studioで発表当日から順次提供(APIの更新履歴では一般提供=GAと記載)
  • 一般向け:Flash TTSは「Gemini Notebook」、Flash-Lite TTSは動画作成アプリ「Google Vids」で順次提供
  • 企業向け:発表時点では「Gemini Enterpriseで近日提供」。その後、Google Cloudの「Gemini Enterprise Agent Platform」のドキュメントに、2026年9月28日付でプレビュー版として掲載

Google AI Studioには、声のデザインや複製を試し、そのまま2人用の台本エディターでセリフを演出できる専用の画面が用意されています。プログラムを書かなくても、ブラウザ上で声づくりから試聴まで体験できます。ただし、AI Studioでの声の複製は、米国のイリノイ州・テキサス州、EEA(欧州経済領域)、英国、スイス、インドでは利用できないと注記されています。日本はこの対象外リストには含まれていません。

Gemini APIを使ったサービスとしては、Agora、LiveKit、Pipecat、Vercelといった開発基盤が対応を進めており、Figma、HeyGen、Wondercraftなどの企業が、吹き替えや多言語化、音声エージェントへの組み込みを進めていると紹介されています。

ビジネスでの使いどころ

専門的な機材や声優の手配がなくても、「声を使ったコンテンツ」を小さく始めやすくなるのが今回の価値です。たとえば次のような使い方が考えられます。

  • 社内研修・マニュアル動画のナレーション:原稿を直すたびに録り直す手間がなくなる。ブランド用の声を1つ決めておけば、全動画の声をそろえられる
  • ブログや社内報の「音声版」:記事を読み上げ音声にして、移動中でも聞けるようにする。大量に作るならFlash-Lite TTSが向く
  • 2人の対談形式のポッドキャスト:解説役と聞き役の掛け合い台本を書けば、あいづち入りの自然な番組風音声にできる
  • 電話の自動案内や音声エージェントの声:ドキュメントには、日本の電話システムでも使われる音声形式での出力にも対応していると記載されている
  • 商品紹介動画の多言語化:同じ台本を英語・中国語などに訳し、それぞれの言語で読み上げさせる

最初は、社内向けの短いナレーション1本から試すのがおすすめです。AI Studioで声を選び、原稿を読ませて、聞きやすさや読み間違いを確認する。そこで手応えがあれば、外向けの動画や大量の音声化へ広げていく、という順番が安全です。

使う前に押さえておきたい注意点

  • 声の権利と同意:声の複製は、自分の声か、使う権利を持っている声に限られます。社員やタレントの声を使う場合は、本人の同意と社内ルールを先に整えましょう
  • AI音声である目印:Gemini Audioが生成するすべての音声には、耳では聞こえない電子透かし「SynthID」が埋め込まれます。声の複製にはC2PAという来歴情報の仕組みも使われています
  • 料金改定の時期:2027年1月1日から料金が2倍になるため、年明け以降の予算もあらかじめ見込んでおくと安心です
  • 保存できる声の数:作成・複製して保存できる声は1プロジェクトあたり200個まで。1年間使わなかった声は自動で削除されます
  • 一般向けアプリの提供状況:Gemini NotebookやGoogle Vidsでの提供は「順次」とされており、日本のアカウントでいつ使えるかは公式には明示されていません

まとめ

Gemini 3.8 TTSは、文章を声にする技術を「声を選ぶ」段階から「声を作り、演技まで指示する」段階へ進めたモデルです。品質重視のFlash TTSと、速さとコスト重視のFlash-Lite TTSの2本立てで、日本語にも対応しています。料金は2026年末までが導入価格で、2027年からは2倍になりますが、それでも音声出力の単価は前世代より低い設定です。一方で、声の複製には本人の同意が必須で、生成された音声にはAI製であることを示す透かしが入ります。研修動画や記事の音声化など、まずは社内の小さな用途で「自社の原稿をどれだけ自然に読めるか」を試してみるのが、上手な付き合い方の第一歩になりそうです。

参考リンク

この記事を書いた人
この記事を書いた人

毎日20時間以上AIの実践・研究に没頭するITエンジニア。20年以上にわたり、オンラインゲームや生活関連など幅広いジャンルのオウンドメディアで執筆・編集長を歴任。現在は上場企業グループの代表取締役を務め、複数の事業者団体で理事を兼務する経営者でもある。テクノロジーの最前線に身を置きつつ、地域の商店街や神社の運営にも深く携わるなど、地域活性化にも尽力。圧倒的な現場経験とITの専門知識、経営者の視点から、信頼性の高い有益な情報を発信している。
Olive株式会社 代表取締役

tanakaをフォローする
コラム
シェアする
tanakaをフォローする

コメント

タイトルとURLをコピーしました