Tutorials
[長篇評論] Axial Attention in Multidimensional Transformers
對影像或影片進行完整自注意力在計算上極其昂貴,那麼如何在不引入二次方複雜度的情況下保持Transformer的表現力?
Tutorials
[短篇評論] Axial Attention in Multidimensional Transformers
Axial Attention是一個優雅的想法,它使Transformers對高維數據保持可控:無需一次性對所有像素或所有時頻箱進行注意,而是每次只沿著一個軸進行注意。
Tutorials
[長評論] 從說話人驗證到多說話人TTS合成的遷移學習
這是使零樣本語音克隆成為實用的論文:在具有數千個嘈雜、無文本記錄的語音上訓練說話人編碼器進行判別性驗證任務,然後將這些嵌入輸入到Tacotron 2 s
Tutorials
[短評論] 從說話人驗證到多說話人TTS合成的遷移學習
Google的論文啟動了現代零樣本語音克隆浪潮,具有簡潔優美的架構:一個在驗證上訓練的說話人編碼器、一個Tacotron 2合成器可將文本加說話人嵌入轉換
Tutorials
[長評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型
大多數語音預訓練集中在編碼器端,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要預訓練的解碼器。
Tutorials
[短評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型
像wav2vec 2.0這樣的自監督預訓練給了我們很好的語音編碼器,但如果你想要一個完整的編碼器-解碼器ASR系統,解碼器仍然從零開始。
Tutorials
[長篇評論] Towards Zero-Label Language Learning
如果您可以在沒有任何人工標註範例的情況下訓練任務特定的 NLP 模型呢?"Towards Zero-Label Language Learning" 著力強調了這個問題。
