From OpenAI's Whisper Model to Your Own In-House ASR Service: Long Audio and Streaming (Part 3)

Tutorials

從 OpenAI 的 Whisper 模型到自研 ASR 服務:長音訊和串流(第三部分)

Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。

Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。幻覺重複、靜音段漂移和隨著音訊長度增加而激增的延遲都是同一基本限制的症狀——該模型最初不是為長格式或串流而構建的。本 Whisper 部署系列的第 3 部分直接解決了這兩個問題。

該段涵蓋了長音訊推理的實用策略:基於 VAD 的分塊、重疊與縫合以避免邊界偽影,以及使用前一個窗口的文本作為解碼器提示以保持上下文流動。在串流方面,它涵蓋了帶有前瞻的分塊解碼、調整延遲和穩定性之間的權衡,以及社區的串流 Whisper 分支(如 whisper-streaming 和 faster-whisper)在哪些方面真正有幫助,以及在哪些方面你仍然需要自定義粘合代碼。如果你正在構建即時字幕、會議機器人或任何必須轉錄超過 Whisper 感受野的音訊的產品,本系列的這一部分值得觀看。