從 OpenAI 的 Whisper 模型到自研 ASR 服務:後處理和語言建模
原始 Whisper 輸出開箱即用確實令人印象深刻,但任何將其部署給真實用戶的人都知道演示轉錄文本和下游系統實際可以消費的東西之間存在差距。
原始 Whisper 輸出開箱即用令人印象深刻,但任何已將其發布給真實用戶的人都知道演示轉錄和下游系統實際可以使用的內容之間存在差距。數字被拼寫成文字而非數字,專有名詞被破壞,標點符號不一致,而領域術語被轉錄為最接近的音標猜測。Whisper 自研 ASR 系列的這第四部分著重於後處理和語言建模層來彌補該差距。
本演練涵蓋反向文本正規化、標點符號和大小寫恢復、向自定義詞彙傾斜以及如何與 Whisper 解碼器組合外部語言模型——包括淺融合、重新評分和提示條件解碼之間的權衡。它還指出天真的修復在哪裡會產生反效果(過度偏差損害一般精度,激進的 ITN 破壞時間戳),以及如何正確評估管道。如果你在盯著一堆 Whisper 轉錄,想知道為什麼 WER 看起來不錯但客戶投訴不斷出現,這個深入分析值得你花時間。
