★4 LLM ITmedia AI+ by Synapse Flow 編集部

ゼロから声を作れる音声生成モデル「Gemini 3.8 Flash TTS」公開 「Gemini Notebook」でも利用可能に

記事のポイント

📰ニュース

Googleが、ゼロから声を生成し感情制御も可能な音声生成モデル「Gemini 3.8 Flash TTS」を公開しました。

🔍注目ポイント

自然言語で声質をゼロから生成でき、演技や感情の細かな制御、多言語対応、透かし技術埋め込みが特徴です。

🔮これからどうなる

開発者はより表現豊かな音声コンテンツを容易に作成でき、ユーザーは多様な声の体験を得られるでしょう。

従来の音声生成モデルは既存の声から選択する方式でしたが、本モデルは自然言語で声の特性を記述することで、全く新しい声を作り出せます。
日本語を含む多言語に対応し、生成された音声にはGoogleの透かし技術「SynthID」が埋め込まれるため、AI生成音声の識別が可能です。
開発者向けAPIや「Gemini Notebook」で順次利用可能になります。
💡
編集部の視点

この新しい音声生成モデルは、ゲームやオーディオブックなど、様々なコンテンツ制作に革新をもたらしそうです。特に、声の表現力が格段に向上するので、私たちの耳にする音声体験が豊かになるかもしれませんね。

元記事を読む →

関連記事