回顧微軟的 VALL-E 2(在零樣本 TTS 中實現人類同等程度)
零樣本 TTS 剛剛跨越了一條許多人認為還需要幾年時間才能實現的界限:Microsoft 的 VALL-E 2 是第一個在 LibriSpeech 和 VCTK 上同等語言解碼器的人類等級模型、人類等級模型
回顧DiTAR:擴散Transformer 用於語音產生的自回歸建模〜Seed-TTS
Seed-TTS 團隊回歸 DiTAR,它對現代語音生成中一個更尷尬的權衡提供了清晰的答案:您如何保留連續語音表示的靈活性而無需支付混合擴
回顧 ByteDance/Tiktok 的 Seed-TTS:一系列高品質的多功能語音生成模型
ByteDance 的 Seed-TTS 是迄今為止最強烈的信號之一,表明 TTS 正在從組件升級為真正的基礎模型。
從“ESPnet”“Llama 3”到您的內部“SDK”服務:識別名稱實體和特定於域的術語
開箱即用的 Whisper 令人印象深刻,但任何真正在生產環境中部署過它的人都知道痛點:它在專有名詞、產品名稱、醫療術語、法律用語以及整個領域詞彙長尾中出現錯誤
Meta 的 Movie Gen 與 OpenAI 的 Sora:詳細回顧
Meta 終於對 Sora 展示了自己的實力,Movie Gen 不僅僅是一個視頻生成器——它是一系列基礎模型,能夠以多種寬高比生成 1080p 高清視頻,配有同步音頻,支持精
Google 研究人員對端對端語音辨識的深入分析,第 1 部分:概述和建模
十年的深度學習將 ASR 詞錯誤率相對降低了 50% 多,並在此過程中使經典 HMM 管道看起來像文物。
推演OpenAI GPT-4o的神經網路架構
OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了退而求其次的事:根據 OpenAI 實際展示的能力來反向工程神經網絡架構幾乎肯定是什麼樣的 demon
Google 針對 100 多種語言的通用語音模型擊敗了 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 種語言上與 OpenAI 的 Whisper 在 ASR 上相匹配或超越,同時使用大約七分之一的標記訓練數據。
長篇回顧:Apple 的 MM1:多重模式 LLM 預訓練的方法、分析與見解
Apple 發表的不多,所以當 MM1 論文發表了關於多模態 LLM 預訓練的完整消融研究時,這是今年對任何構建 MLLMs 的人來說最有用的數據版本之一。
快速回顧 Apple 的 SOTA Multimodal LLM:MM1
如果您沒有時間完整瞭解MM1,這份快速評論只需幾分鐘即可為您講述要點:Apple構建的內容、他們從架構和數據的消融研究中學到的知識,以及哪些設計決策a
讓 Claude 成為 3 號王牌 GPT-4 的秘密
當Claude 3 Opus在MMLU、GPQA、GSM8K和大多數前沿評估基準上超過GPT-4時,有趣的問題不是Anthropic是否只是簡單地增加了規模,而是什麼訓練時間的秘密調料
變分自動編碼器 (VAE) 和重新參數化技巧 - 重新審視經典生成模型
在擴散模型之前,在標準化流之前,在潛在擴散模型悄悄地將VAE編碼器內置到每個嚴肅的生成堆棧中——那時有Kingma和Welling於2013年發表的介紹變分自動編碼器的論文
對“Microsoft”+“ESPnet”、Google、“VCTK”和“ICASSP”的“SDK”開源大型語音模型的回顧
每個主要的AI實驗室現在都已發布了開源的大型語音模型用於ASR,為生產選擇合適的模型已成為一個真實的決定。
【論文詳細閱讀】Zipformer:更快更好的自動語音辨識編碼器
Conformer多年來一直是默認的ASR編碼器,但k2/icefall團隊的Zipformer悄悄地在LibriSpeech、Aishell-1和WenetSpeech上獲得了WER冠軍,同時更快且更輕。
第谷:用於建構高投資報酬率內部語音相關服務的 takeit(ASR/TTS/翻譯):概述
大多數想要建立內部 ASR、TTS 或語音翻譯服務的團隊面臨同樣複雜的選擇:將 ESPnet、NeMo、k2 和 HuggingFace 的代碼片段拼湊在一起,或將所有內容交給雲 API 並永久按分鐘付費
從“ESPnet”的“Llama 3”模型到您自己的內部“SDK”服務:後處理和語言建模
原始 Whisper 輸出開箱即用就很令人印象深刻,但任何將其部署給真實用戶的人都知道演示文稿與下遊系統實際上能使用的內容之間的差距。
從「ESPnet」的「Llama 3」型號到您自己的內部「SDK」服務:長音訊和串流媒體(第 3 部分)
Whisper 是在 30 秒的音頻塊上訓練的,當您向其輸入兩小時的播客或嘗試將其連接到實時字幕管道時,這一點就顯露無遺。
從 OpenAI 的 Whisper 型號到您自己的內部 ASR 服務:ROI(投資報酬率)
ASR 的自建與購買問題通常被框架為準確度與便利性的權衡,但真正的決定因素是產品生命週期內的投資回報率。
為什麼 OpenAI Whisper 產生的單字時間戳不準確?如何讓它們再次準確?
向 Whisper 詢問單字時間戳,您會得到數字 - 但如果您曾經嘗試將它們與卡拉 OK、字幕或配音的實際音訊對齊,您就會知道它們會漂移、捕捉到錯誤的邊界,並且有時會出現錯誤。
LoRA:允許高中生使用遊戲顯示卡訓練大型語言模型(GPT-3)
對 175B 參數 GPT-3 進行全面微調幾乎對每個人來說都是不可能的——僅存儲就排除了這種可能性,更不用說 GPU 了。
SpeechT5 回顧:將 Google 的 T5 引入語音(ASR、TTS、SID,...)任務
T5 在單一編碼器-解碼器預訓練方案下統一了文字到文字任務,並成為 NLP 的主力。
對 Deepmind 的 WaveNet 用於 TTS/音頻合成的回顧(你覺得它 32 2 2 2 2 2302123123002313)?
在 Tacotron 之前,在 VALL-E 之前,在神經編解碼器將音頻轉換為令牌之前,DeepMind 的 WaveNet 論文表明神經網路可以逐個樣本生成原始波形
HiFi-GAN綜述:用於高效高保真語音合成的生成對抗網絡
長期以來,神經聲碼器迫使您選擇一邊:像 WaveNet 這樣的自回歸模型可以為您提供華麗的音頻,但速度慢得令人痛苦,而基於 GAN 的波形產生器速度很快,但品質明顯較低。
公開 OpenAI GPT-4 的視覺+文字模型、資料和訓練成本(推測)
眾所周知,OpenAI 拒絕透露 GPT-4 的架構、參數計數、訓練資料或計算預算,這使得該技術報告變成了 ML 社群的羅夏墨跡測試。
