再現性◎カスタム◎Google Cloud TTSで音声生成実験

再現性◎カスタム◎Google Cloud TTSで音声生成実験|makoto_honikaze

Google Cloud TTSのPython呼び出しにSSMLを組み込み、ニュース原稿の間・速度・強調を変える実験。

著者はChatGPTを補助にAPI呼び出しを作成し、ja-JP-Neural2-Bで音声をWAVへ保存。素の読み上げを基準にタグを追加し、同じ原稿のどこを調整するかを段階的に示す。

学習・生成の基本形:入力SSML、音声の指定、音声形式を設定してAPI結果をファイルに保存するコードを掲載。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n65498d234bd5

学習・間の調整:原稿の文間にbreakを挿入し、区切りの長さを変えて試す。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n65498d234bd5

学習・局所的な演出:原稿の一部へprosodyやemphasisを加え、全体変更と語句単位の変更を区別する。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n65498d234bd5

対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)

確認事項(編集部):2025年7月の指定音声を使った実験。掲載コードは再実行しておらず、完全再現性や全音声でのタグ対応を保証しない。

出典:makoto_honikaze「再現性◎カスタム◎Google Cloud TTSで音声生成実験」/公開・更新情報:2025-07-10/確認日:2026-09-14/https://note.com/makoto_honikaze/n/n65498d234bd5

関連ページ


株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp