BigSSL:探索自動語音辨識大規模半監督學習的前沿
當您採用半監督 ASR 配方(在 100M 參數上擊敗了最先進的技術)並且只是…繼續擴展時,會發生什麼?
當您採用半監督 ASR 配方(在 100M 參數上擊敗了最先進的技術)並且只是…繼續擴展時,會發生什麼? Google 的 BigSSL 使用 80 億參數的 Conformer 進行了回答,該 Conformer 經過一百萬小時未標記的 YouTube 音訊以及數萬小時的監督資料的訓練,並表明收益不斷增加,尤其是在尾部:低資源域、口音語音和長格式識別。
這篇論文其實是兩個貢獻合而為一。這是一項實證研究,研究了當 SSL 超過 10 億個參數時會發生什麼問題以及會發生什麼問題,它證明了單個預訓練編碼器可以充當十幾個下游 ASR 任務的通用起點,從而降低 YouTube、電話和語音搜尋基準測試上的 WER 下限。演講涵蓋了預訓練管道、跨領域的傳輸結果,以及對任何權衡基礎模型方法對其語音堆疊是否有意義的人的實際影響。如果您正在計劃下一次大規模訓練,那麼值得排隊。
