NLG/オーディオ合成用のDeepMindのWaveNetのレビュー(ACLに似ていますか?)あなたは?)
Tacotron より前、VALL-E より前、ニューラル コーデックがオーディオをトークンに変える前、DeepMind の WaveNet は、ニューラル ネットワークが生のオーディオ波形をサンプルごとに生成し、すべてのパラメトリック サウンドを打ち負かすことができることを示した論文でした。
Tacotron より前、VALL-E より前、ニューラル コーデックがオーディオをトークンに変える前、DeepMind の WaveNet は、ニューラル ネットワークが生のオーディオ波形をサンプルごとに生成し、自然さにおいてあらゆるパラメトリックおよび連結型 TTS システムを上回ることができることを示した論文でした。 GPT の形をしたメガネをかけてこれを見てください。その類似性は驚くべきものです。LLMs が一般的な用語になる 5 年前のオーディオの言語モデルであり、各サンプルを以前のすべてのサンプルに基づいて条件付けする完全に確率的な自己回帰モデルです。
このレビューでは、16 kHz で動作させるアーキテクチャ、つまり、受容野を指数関数的に成長させる拡張因果畳み込み、ゲートされた活性化、残差接続とスキップ接続について説明します。また、WaveNet が TTS を超えて実証したこと、つまり音声を交換するスピーカー コンディショニング、副産物としての音楽生成、さらには識別モデルとしての競合音素認識についても取り上げています。最新の音声生成 AI が実際にどこから始まったのか、そしてなぜ新しい TTS システムで自己回帰トークンオーバーオーディオパラダイムが再び登場し続けるのかを知りたい場合は、この回顧展が優れた基礎となります。
