UniSpeech-SAT:具有說話人感知預訓練的通用語音表示學習
自監督語音模型往往能很好地學習語音內容,但把說話人身份視為事後考慮——這對ASR是可以的,但對說話人驗證、說話人分割或語音克隆是很糟糕的。
自監督語音模型往往能很好地學習語音內容,但把說話人身份視為事後考慮——這對ASR是可以的,但對說話人驗證、說話人分割或語音克隆是很糟糕的。UniSpeech-SAT(來自Microsoft)通過將明確的說話人感知目標注入到HuBERT-style預訓練中來彌補這一差距:逐話語的對比損失和話語混合,強制編碼器表示誰在說話,而不僅僅是說了什麼。
這種收益體現在SUPERB基準上,UniSpeech-SAT在說話人識別、驗證和說話人分割方面表現特別強勁,同時在ASR和音素識別方面也表現得不俗。本次演講深入探討了話語混合是如何構建的,為什麼額外的對比項不會損害內容學習,以及該設計如何為隨後的WavLM鋪平了道路。如果你正在構建任何需要區分聲音的應用——從會議轉錄到生物識別認證——這值得你花10分鐘的時間。
