Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」公開 音声合成「MAI-Voice-2.1」と高速版も
記事のポイント
📰ニュース
Microsoftが初のストリーミング文字起こしモデルと高性能な音声合成モデル群を公開しました。
🔍注目ポイント
低遅延な逐次認識と声のトーンを保った多言語合成が可能で、音声エージェント構築に特化しています。
🔮これからどうなる
リアルタイム性の高い音声AIアプリケーション開発が加速し、ユーザー体験が向上するでしょう。
Microsoft AIが発表したのは「MAI-Transcribe-2-Streaming」と「MAI-Voice-2.1」およびその高速版です。
これらはMicrosoft Foundryでプレビュー提供されており、複合デモも公開されています。
特に、逐次認識と多言語合成の組み合わせは、グローバルな音声対話システムの実現に貢献します。
これらはMicrosoft Foundryでプレビュー提供されており、複合デモも公開されています。
特に、逐次認識と多言語合成の組み合わせは、グローバルな音声対話システムの実現に貢献します。
Microsoftがリアルタイム音声AIの分野で大きな一歩を踏み出しましたね。これにより、私たちの生活における音声アシスタントの応答速度が格段に向上しそうです。