2026年9月
    月 火 水 木 金 土 日
     123456
    78910111213
    14151617181920
    21222324252627
    282930  

    文章で注文するだけで、声を一から作れる。Gemini 3.8 Flash TTSのVoice Designで、解説動画のAIキャラクターの声を作り直しました。声は30秒ほどでできましたが、その手前には前払い800円の手続きがありました。同じ原稿を3回読ませて測った結果と合わせて、実際に触って分かったことをまとめます。

    私が作っている解説動画には、「伊野部トピ子」という解説役のAIキャラクターが出てきます。声はこれまで、パソコンで動く音声合成ソフトのAivisSpeechで作ってきました。

    Googleが9月23日に発表したGemini 3.8 Flash TTSには、欲しい声を文章で説明して作る「Voice Design」という機能があります。トピ子の声を、この機能で作り直してみました。声を作るまでの手順と、同じ原稿を読ませた結果をまとめます。

    声の入口は2つ

    「Create voice」の画面。文章で声を作る「Voice Design」と、録音から声を写す「Voice Replication」の2つの入口が並ぶ。

    Google AI Studioの音声生成の画面で「Create new voice」を押すと、入口が2つ出てきます。声を言葉で説明して作る「Voice Design」と、短い録音から声を写す「Voice Replication」です。

    複製のほうは使いませんでした。複製には、元の声の持ち主が同意文を読み上げた録音が要ります。トピ子の今の声はAivisSpeechの音声モデルの声で、その同意を私は用意できません。トピ子は実在しない人物なので、文章で一から声を作るのが筋だと考えました。

    声を作る前に、前払いの800円

    Voice Designを開いた画面。有料枠でのみ実行できるため、プロジェクトとAPIキーの選択、支払い情報の設定、APIキーのリンクの3段階を求められる。

    私の環境では、Voice Designを開くと有料枠への切り替えを求められました。GoogleのVoice Designの説明文書には、有料枠に限るという記述は見当たりません。触ってみて初めて分かったことです。

    手続きは3段階でした。プロジェクトとAPIキーを選ぶ、支払い情報を設定する、APIキーをリンクする。私のアカウントには有料枠用のプロジェクトがなかったので、既定のプロジェクトとAPIキーがこの場で自動で作られました。

    有料枠のクレジットの購入画面。800円から選べる前払い制で、Gemini APIのみで使え、1年で失効する(支払い方法と請求先アカウントのIDはぼかし処理)。

    意外だったのは、私に提示されたのが前払いのプランだったことです。使った分をあとで払う代わりに、先にクレジットを購入します。私の画面では800円、3,200円、16,000円を選べ、別の金額も指定できました。購入したクレジットはGemini APIの利用にしか充てられず、原則として払い戻されず、購入から1年で失効します。

    Googleの案内によると、新しく有料枠に移る利用者は原則として前払いのプランになり、最低購入額は5ドル相当です。アカウントによっては後払いのプランを選べる場合もあります。

    私は最小の800円を選び、残高が減ると自動で買い足す「オートチャージ」はオフにしました。画面ではオートチャージに「推奨」の印が付いていますが、試すだけなら要りません。

    有料枠の設定の完了画面。Google Cloudの請求先アカウントとGemini APIのプロジェクトがリンクされ、有料枠が有効になったと表示されている。

    手続きは10分ほどで終わりました。声を作る作業そのものより、ここまでのほうが長くかかります。

    なお、AI Studioの画面の左下には、10ドルの特典4件、計40ドル分のクレジットの案内も出ていました。有料化の手続きの途中では案内されなかったので、私は800円を払ったあとで引き換えています。Googleの案内では、前払いのプランの利用者は、先に前払いのクレジットを購入しないと、こうした特典をGemini APIに使えません。特典だけで前払いを省くことはできない仕組みです。

    日本語で注文して、30秒で3つの候補

    Voice Designの入力画面に、声の名前「伊野部トピ子」と、日本語の声の説明文を入力したところ。

    入力欄は2つだけです。声の名前と、声の説明。説明の欄には、声質、年齢、性別、音の高さ、話す速さ、アクセント、トーン、話し方の癖を書くよう案内があり、具体的なほど良い結果になると添えられています。例文はすべて英語でしたが、名前も説明も日本語で受け付けました。

    トピ子の設定から起こした説明文に、私は「少し鼻にかかった柔らかさ」と「上品で控えめな色気」を足しました。入れた文は次のとおりです。

    20代後半から30代前半の日本人女性。落ち着いた知的な声で、ニュースを解説する人のように明瞭に話す。中音域で、少し鼻にかかった柔らかさがあり、上品で控えめな色気がある。甘すぎない。標準語のアクセント。早口にならず、語尾をはっきり言い切る。

    3つの声の候補が生成された画面。「伊野部トピ子」の1から3までの候補を再生して聞き比べ、1つを選ぶ。

    「Generate voice」を押すと、30秒ほどで3つの候補が出ました。同じ説明文なのに、3つは特徴の違う声です。それぞれが別の短い文を読み上げ、どれもニュースで使うような言葉が多く含まれていました。説明文の「ニュースを解説する人のように」に、試し読みの文まで合わせているように私には聞こえました。

    私は1番目を選びました。文章で注文しても、最後は耳で選ぶ仕組みです。

    話者の設定の画面。自分で作った声の欄に「伊野部トピ子」の3つの候補が並び、その下に2,000以上の既製の声が用途別に並ぶ。

    あとで話者の一覧を開くと、自分で作った声の欄に、選ばなかった2番目と3番目も残っていました。Googleのドキュメントでは、保存できる声は1つのプロジェクトで200件までです。ただ、今回の3つの候補がこの枠にどう数えられるかは、確かめられていません。

    同じ一覧では、既製の声を探す欄に「2,000以上」と表示され、言語、性別、音の高さ、スタイル、用途で絞り込めました。Googleの発表文も同じ数を挙げていますが、APIのドキュメントには別の数え方が書かれています。

    同じ原稿を3回読ませた

    台本の画面。話者として「伊野部トピ子 1」が選ばれ、本文の欄とは別に、話し方の指示(Style)と表現のタグ(Expression)を入れる欄がある。

    台本の画面では、本文の欄とは別に、話し方の指示(Style)と、笑いや息づかいのタグ(Expression)を入れる欄があります。今回はどちらも既定のままにしました。

    原稿は、発表の内容を縦動画1本分(311字)にまとめたものです。「Gemini 3.8 Flash TTS」「Google DeepMind」「SynthID」「C2PA」「0.0135ドル」「71.4」など、読み間違えやすい語を意図して入れています。同じ原稿を3回生成し、AivisSpeechでも1回録りました。

    音声
    長さ
    話速
    0.25秒以上の間

    AivisSpeech
    57.64秒
    324字/分
    23回

    Gemini 1回目
    55.40秒
    337字/分
    23回

    Gemini 2回目
    57.20秒
    326字/分
    15回

    Gemini 3回目
    53.64秒
    348字/分
    11回

    同じ原稿(311字)を読ませた結果。長さと間は、音声ファイルから筆者が計測

    聞いた印象は、3回とも同じでした。同じファイルを3回再生したのかと思ったほどです。ところが長さを測ると、いちばん短い回と長い回で約3.6秒違いました。私の無音の判定では、0.25秒以上の間の回数も、23回から11回まで開きがありました。耳では気づかない範囲で、間の取り方が毎回変わっていたことになります。

    読み間違いは、3回ともありませんでした。AivisSpeechでは、25語の読み方辞書を入れて正しく読ませている語です。Geminiは何も指定せずに読み切りました。原稿にない言葉が足されたり抜けたりすることもなく、声も3回とも、候補で選んだときのままでした。

    動画に組み込むときの注意

    実際の制作に使うなら、気をつけたい点が4つあります。

    1つ目は、尺の見積もりです。私は縦動画の原稿を、AivisSpeechの話速から逆算して書いています。今回の3回では、尺が数%動きました。60秒の枠で作るなら余裕を取り、生成したあとの実際の長さで字幕を合わせることになります。字数だけで尺を決める作り方には向きません。

    2つ目は、音声の形式と音量です。今回の出力ファイルは、Geminiが24kHz、AivisSpeechが44.1kHzでした。私が測った平均の音量は、Geminiのほうが約2.5dB小さく、動画に組み込むときは音量をそろえる必要があります。

    3つ目は、作った声を選んだときの挙動です。私は有料のAPIキーをブラウザーに保存しない設定にしていました。それでも私の環境では、画面を開き直して作った声を選ぶと、有料のキーに切り替わりました。Googleの案内では、AI Studioは無料で使えますが、有料のキーをリンクすると、そのキーでの利用には料金がかかります。生成する前に、画面で選ばれているキーと話者を確かめることにしました。

    4つ目は、プログラムから呼び出す場合です。私が画面右上の「Get code」で開いたコードでは、声の指定に画面の表示名(「伊野部トピ子 1」)が使われ、声のIDは見つかりませんでした。Googleのドキュメントでは、作った声は「voice_」で始まるIDで呼び出し、AI StudioからそのIDをコピーできると説明しています。声を作ったときの説明文も、コードでは毎回の話し方の指示として丸ごと送られていました。ドキュメントは、声の変わらない特徴は声の設計に書き、毎回の指示は短くするよう勧めています。このコードがAI Studioの外で動くかは、試せていません。

    費用

    声を作って3回生成したあと、利用額の画面には、その月の費用として24円と表示されました。3回分の音声の長さ(計166秒)から、発表の単価で音声出力分だけを見積もると約6円です。24円の内訳と、どの操作にいくらかかったのかは、画面からは分かりませんでした。

    前払いの残高は、声を作った直後に797円、3回生成したあとに800円と表示されました。Googleの案内では、前払いの残高より先に、引き換えた特典が使われます。私は途中で40ドルの特典を引き換えているので、購入した800円から実際にいくら引かれたかは、この表示だけでは分かりません。

    トピ子の声は、Geminiへ

    私は、トピ子の声をGeminiに移すことにしました。決め手は、3回とも同じファイルかと思うほど声がそろっていたこと、そして25語の読み方辞書で支えてきた固有名詞を、何も指定せずに読み切ったことです。尺が毎回数秒ずつ動く点は、字幕を実際の音声から起こす今の作り方なら吸収できます。

    一方で、ほかのキャラクターはAivisSpeechに残します。今回、作った声は有料のAPIキーで使っており、生成のたびに利用料金がかかります。登場の回数が少ないキャラクターまで移す理由は、今のところ見当たりません。キャラクターごとに、使う頻度を見て決めていくつもりです。

    声を作る作業は、日本語の数行と30秒で済みました。私の場合、その手前に必要だったのは、有料枠への切り替えと800円の前払いでした。

    【用語解説】

    Voice Design
    Gemini 3.8 Flash TTSの機能の1つ。年齢や声質、話す速さなどを文章で説明すると、その特徴を持つ新しい声を生成する。今回のGoogle AI Studioでの検証では、有料枠への切り替えを求められた。

    Voice Replication
    Gemini 3.8 Flash TTSの機能の1つ。短い録音から、その人の声を写し取る。声の持ち主本人が所定の同意文を読み上げた録音が必要で、2つの録音の話者が一致するかを確かめてから声を作る。

    APIキー
    プログラムや外部のサービスからAPIを呼び出すときに、利用者を識別するための文字列。Gemini APIでは、有料枠の利用と請求がこのキーとプロジェクトに結びつく。

    kHz(キロヘルツ)
    音声を1秒間に何回記録するかを表す値(サンプリング周波数)。24kHzは1秒に2万4,000回、44.1kHzは4万4,100回記録する。値が異なる音声を混ぜるときは、どちらかにそろえる。

    【関連記事】

    Gemini 3.8 Flash TTS、声の複製に本人の同意録音
    Gemini 3.8 Flash TTSの発表を読み解いた記事。声を文章で作る機能と、複製に本人の同意録音を求める仕組みを整理した。

    Gemini 3.8 Live、GPT-Live-1と分かれた音声AIの設計
    同じGemini 3.8世代の音声対話モデルを扱った記事。台本を読むTTSと対になる、考えながら話すAIの設計を読み解いた。

    【編集部後記】

    声の説明文を書くとき、私はトピ子の設定を思い浮かべながら、年齢から話し方の癖まで6つの文を並べました。あとでGoogleのドキュメントを読むと、説明は1〜2文で具体的に書くほうが、すっきりとした一貫性のある声になるとありました。

    6文でも、3回とも同じ声に聞こえるほど安定していました。それでも、言葉を削ったときに声のどこが変わるのかは、まだ聞いていません。トピ子らしさを残したまま、説明文をどこまで短くできるのか。次はそこを試してみます。

    【参考リンク】

    Google AI Studio(外部)
    Googleの開発者向けツール。ブラウザー上で声の設計や音声の生成を試せる。今回はVoice Designで有料枠への切り替えを求められた。

    Gemini API|Speech generation(外部)
    GeminiのTTSモデルの使い方をまとめた公式文書。声の設計と保存、本文と話し方の指示の分け方、保存できる声の上限を説明する。

    Gemini API|Voice design(外部)
    声の設計の公式文書。作った声をvoice_で始まるIDで呼び出す方法と、説明文は1〜2文で具体的に書くといった勧めを載せる。

    Gemini API|Billing(外部)
    Gemini APIの請求の仕組みを説明した公式文書。前払いと後払いのプラン、最低購入額、特典クレジットの使われる順番を扱う。

    Gemini API|Pricing(外部)
    Gemini APIの料金表。Flash TTSは2026年末までの期間限定価格で、音声は1秒25トークンとして計算する。

    AivisSpeech(外部)
    Aivis Projectが開発する日本語の音声合成ソフト。パソコン上で動き、読み方を登録するユーザー辞書を備える。今回の比較の基準。

    Share.

    Comments are closed.