Understand Microsoft's VALL-E in 3 Minutes (SOTA Zero-shot TTS)

Tutorials

3 分鐘內了解Microsoft 的VALL-E(SOTA 零射擊TTS)

VALL-E 是 TTS 不再看起來像是訊號回歸並開始看起來像語言建模的時刻,這個快速解釋器可以讓您快速上手。

VALL-E 是 TTS 不再看起來像是訊號回歸並開始看起來像語言建模的時刻,這個快速解釋器可以讓您快速上手。 Microsoft 在現成編解碼器產生的離散音訊標記上訓練神經編解碼器語言模型,將訓練資料擴展到 60,000 小時的英語語音,並將文字轉為語音重新建構為條件下一個標記預測。結果是一個模型,可以從三秒的聲音提示中克隆出一個看不見的說話者,具有最先進的自然度和說話者相似性。

更深層的故事是音訊領域中情境學習的出現。 VALL-E 保留了說話者的情感,甚至提示的聲學環境,這是舊式串聯和神經 TTS 系統在這種品質上無法比擬的。對於任何提供語音克隆、配音或個性化助手的人來說,這篇論文重新繪製了地圖,並掀起了隨後的編解碼器 LM TTS 浪潮。如果您有三分鐘的時間,並且想要在沒有全文的情況下獲得核心直覺,請點擊播放。