[長評論] 從說話人驗證到多說話人TTS合成的遷移學習
這是使零樣本語音克隆成為實用的論文:在具有數千個嘈雜、無文本記錄的語音上訓練說話人編碼器進行判別性驗證任務,然後將這些嵌入輸入到Tacotron 2 s
這是使零樣本語音克隆成為實用的論文:在具有數千個嘈雜、無文本記錄的語音上訓練說話人編碼器進行判別性驗證任務,然後將這些嵌入輸入到Tacotron 2合成器和WaveNet聲碼器。結果是一個TTS系統,可以從幾秒鐘的參考音頻中模仿新說話人,甚至是它在訓練期間從未見過的說話人。
這篇對來自Google的Jia等人工作的長評論詳細介紹了所有三個模塊,即在驗證目標上訓練的說話人編碼器、以嵌入為條件的序列到序列梅爾頻譜圖合成器和自回歸WaveNet聲碼器。它還詳細解析了消融研究,量化了編碼器中泛化所需的說話人多樣性,以及隨機採樣的嵌入產生自然連貫的新穎語音的驚人結果。如果您在語音克隆、個性化TTS或說話人嵌入領域從事任何開發工作,這篇論文是必讀的,而深度探討會逐一講解每個部分。
