★4 研究 EN VentureBeat AI by Synapse Flow 編集部

Black Forest Labsが画像と音声付き20秒動画を生成できる「FLUX 3」を発表、限定公開から開始

Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start

記事のポイント

📰ニュース

Black Forest Labsが画像と最長20秒の音声付き動画を生成できるマルチモーダルモデル「FLUX 3」を発表しました。

🔍注目ポイント

FLUX 3は画像、動画、音声を単一のアーキテクチャで共同学習しており、ロボットの視覚や動作にも応用可能な「視覚知能」を提唱しています。

🔮これからどうなる

企業はクリエイティブ生成、シミュレーション、ロボット工学を統合された能力として捉え、より効率的な開発や新しいアプリケーションの創出が可能になるでしょう。

FLUX 3は、画像生成だけでなく、初の公開動画生成モデルとして、最長20秒の音声付き動画を単一のプロンプトから生成できます。
当初は限定的な早期アクセスプログラムで提供され、FLUX 3 VideoとFLUX 3 Actionが対象です。
将来的にはオープンソース版のFLUX 3 Devもリリースされる予定ですが、現時点では価格やベンチマークの詳細が不足しています。
💡
編集部の視点

画像だけでなく音声付き動画まで生成できるマルチモーダルモデルは、コンテンツ制作の現場に大きな変化をもたらしそうです。特にロボットへの応用も視野に入れている点が面白いですね。

元記事を読む →

関連記事