From OpenAI's Whisper Model to Your Own In-House ASR Service: Overview (Part 1)

Tutorials

從「ESPnet」的「Llama 3」型號到您自己的內部「SDK」服務:概述(第 1 部分)

當 OpenAI 開源 Whisper 時,它悄悄地重置了內部 ASR 服務的基準。

當 OpenAI 開源 Whisper 時,它悄悄地重置了內部 ASR 服務外觀的基線。在您自己的域上微調強大的多語言基礎模型不再是遙不可及的——如果您知道要拉哪些槓桿,這是一個週末項目。該系列的第一部分列出了從 Whisper 檢查點到生產 ASR 端點的完整路徑,該端點針對您的語言、口音和詞彙進行了調整。

該概述將問題分為三個方面。計算:來自 OpenAI 和 Microsoft 的自動微調服務、租用 GPU、或運行您自己的集群。數據:大規模弱標籤的域音頻與較小的高質量標籤生產樣本池配對,而不是經典的全乾淨錄音室錄音方法。算法和部署:PEFT 方法和現有服務堆棧已經足夠好,您不應該從頭開始編寫自己的。該系列的其餘部分深入到每個方面,但如果您想先獲得思維模型,此概述是正確的入口點。