AIで“人間らしい声”を一発生成!Gemini Speech Generation実験レポート|makoto_honikaze
Google AI Studioで同じ原稿と話者を使い、音声のスタイル指示や二人会話の表現を比べた実験。
ナレーション、明るい会話、怒りなどの指示を変え、二人会話では話者別の台詞と声を設定する。著者は息づかいや話者交代を評価する一方、再生成による声質変化、読み誤り、時間制御の難しさを記録した。
学習・条件を固定した比較:同じ原稿と話者モデルを使って、スタイルだけを変えた出力を比べる。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n3b21c3bc3d4a
学習・二人分の役割:聞き手と気象予報士の台詞を分け、各話者の声を設定して会話を生成する。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n3b21c3bc3d4a
学習・修正時の課題:短い部分の差し替えや指定速度が安定しない例を挙げ、再生成時の聞き直しを要する。/確認 2026-09-14/https://note.com/makoto_honikaze/n/n3b21c3bc3d4a
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):2025年7月のGUIによる個人実験。UI項目の意味や秒数指定への対応を現行公式仕様としては扱わない。
出典:makoto_honikaze「AIで“人間らしい声”を一発生成!Gemini Speech Generation実験レポート」/公開・更新情報:2025-07-08/確認日:2026-09-14/https://note.com/makoto_honikaze/n/n3b21c3bc3d4a
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp