ゼロから声を作れる音声生成モデル「Gemini 3.8 Flash TTS」公開 「Gemini Notebook」でも利用可能に
記事のポイント
📰ニュース
Googleが、ゼロから声を生成し感情制御も可能な音声生成モデル「Gemini 3.8 Flash TTS」を公開しました。
🔍注目ポイント
自然言語で声質をゼロから生成でき、演技や感情の細かな制御、多言語対応、透かし技術埋め込みが特徴です。
🔮これからどうなる
開発者はより表現豊かな音声コンテンツを容易に作成でき、ユーザーは多様な声の体験を得られるでしょう。
従来の音声生成モデルは既存の声から選択する方式でしたが、本モデルは自然言語で声の特性を記述することで、全く新しい声を作り出せます。
日本語を含む多言語に対応し、生成された音声にはGoogleの透かし技術「SynthID」が埋め込まれるため、AI生成音声の識別が可能です。
開発者向けAPIや「Gemini Notebook」で順次利用可能になります。
日本語を含む多言語に対応し、生成された音声にはGoogleの透かし技術「SynthID」が埋め込まれるため、AI生成音声の識別が可能です。
開発者向けAPIや「Gemini Notebook」で順次利用可能になります。
この新しい音声生成モデルは、ゲームやオーディオブックなど、様々なコンテンツ制作に革新をもたらしそうです。特に、声の表現力が格段に向上するので、私たちの耳にする音声体験が豊かになるかもしれませんね。