[Olewave's Review]AudioLM:音訊產生的語言建模方法
AudioLM 這篇論文讓許多人相信音訊產生應該更像語言建模而不是訊號處理。
AudioLM 這篇論文讓許多人相信音訊產生應該更像語言建模而不是訊號處理。谷歌的框架將原始波形映射到離散標記,然後在它們上訓練語言模型,將音訊延續投射為下一個標記預測。巧妙的一點是混合標記化:來自屏蔽音頻語言模型的語義標記處理長期結構,而來自神經編解碼器的聲學標記提供高保真合成。它們共同解決了困擾早期方法的權衡問題。
AudioLM 在沒有文字記錄或標籤的原始波形上進行訓練,產生的語音延續在語法和語義上保持一致,同時保留說話者身份和看不見的聲音的韻律。它也超越了言語,產生了看似合理的鋼琴延續,而沒有任何象徵性的音樂表現。這是 VALL-E、MusicLM 和一波基於代幣的 TTS 系統的直接智慧祖先,因此在閱讀後續內容時,了解兩級代幣化器設計會大有裨益。如果您正在建立或評估基於令牌的生成音頻,那麼這篇評論是關於重塑該領域的想法的有價值的入門讀物。
