Black Forest Labsが画像と音声付き20秒動画を生成できる「FLUX 3」を発表、限定公開から開始
Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
記事のポイント
📰ニュース
Black Forest Labsが画像と最長20秒の音声付き動画を生成できるマルチモーダルモデル「FLUX 3」を発表しました。
🔍注目ポイント
FLUX 3は画像、動画、音声を単一のアーキテクチャで共同学習しており、ロボットの視覚や動作にも応用可能な「視覚知能」を提唱しています。
🔮これからどうなる
企業はクリエイティブ生成、シミュレーション、ロボット工学を統合された能力として捉え、より効率的な開発や新しいアプリケーションの創出が可能になるでしょう。
FLUX 3は、画像生成だけでなく、初の公開動画生成モデルとして、最長20秒の音声付き動画を単一のプロンプトから生成できます。
当初は限定的な早期アクセスプログラムで提供され、FLUX 3 VideoとFLUX 3 Actionが対象です。
将来的にはオープンソース版のFLUX 3 Devもリリースされる予定ですが、現時点では価格やベンチマークの詳細が不足しています。
当初は限定的な早期アクセスプログラムで提供され、FLUX 3 VideoとFLUX 3 Actionが対象です。
将来的にはオープンソース版のFLUX 3 Devもリリースされる予定ですが、現時点では価格やベンチマークの詳細が不足しています。
画像だけでなく音声付き動画まで生成できるマルチモーダルモデルは、コンテンツ制作の現場に大きな変化をもたらしそうです。特にロボットへの応用も視野に入れている点が面白いですね。