音声生成AI:Meta AIによるVoiceBox(フローマッチングとニューラルODEも含む)
何年間も、音声生成はスケールと汎用性の両面でテキストと画像生成に遅れていた — すべてのタスクは独自の専用モデルを取得しました。
何年間も、音声生成はスケールと汎用性の両面でテキストと画像生成に遅れていた — すべてのタスクは独自の専用モデルを取得しました。Meta AIのVoiceboxはそのパターンを破りました。これは50,000時間以上のフィルタリングされていない音声で訓練された非自己回帰フローマッチングモデルであり、1つのことをよくするためです:周囲のコンテキストとテキストが与えられた場合のオーディオを埋め込みます。その単一の目的は、ゼロショットTTS、クロスリンガル合成、ノイズ除去、コンテンツ編集、およびスタイル転送をすべて同じチェックポイントから開放します。
レビューは、フローマッチング(およびその下のニューラルODE機械)がスピーチにとってなぜそのような良い適合であるのかを説明します — 連続的で非自己回帰的であり、比較可能な品質において拡散よりも劇的に高速です。また、見出しの数字をコンテキストに置きます:Voiceboxはインテリジビリティ(1.9% vs 5.9% WER)とスピーカーの類似性の両方でVALL-Eを上回り、20倍高速で実行します。音声基盤モデルがVALL-EとWhisper後にどこへ向かっているかを追跡している場合、またはフローマッチングが単にバズワードを読むのではなく実際に何をしているのかを理解したい場合は、深いダイブは聴く価値があります。
