[Olewave's Review] 使用組合 E2E 模型對 SLU 進行標記級序列標記
端對端 SLU 正在風靡一時,但將序列標記視為序列預測悄悄地拋棄了數十年易於理解的標記級標記機制。
端對端 SLU 正在風靡一時,但將序列標記視為序列預測悄悄地拋棄了數十年易於理解的標記級標記機制。本文提出了一種組合式端對端 SLU 設計,該設計保持了 E2E 的簡單性,同時為您提供了代幣級公式,並配有 CRF 式全局標準化損耗和乾淨的每個組件性能監控。對於權衡級聯 ASR 加 NLU 管道與直接 E2E 的團隊來說,這是一條實用的中間路徑。
訣竅是插入一個經過 ASR 訓練的中間解碼器,該解碼器在 NLU 標記器運行之前將語音轉換為標記級表示,因此您可以繼承與預訓練的 ASR 和 NLU 的硬聯組件,而無需支付錯誤的兼容性。在跨 SLU 基準的命名實體識別中,組合模型擊敗了級聯和直接 E2E 基準。深入探討了架構、訓練訊號設計、全域歸一化 CRF 損耗如何重新納入考慮範圍,以及當您實際上必須在生產中調試這個東西時,為什麼每個組件的效能監控很重要。如果您正在交付語音助理、呼叫中心分析或任何在 ASR 之上進行插槽填充和意圖檢測的產品,那麼當您的路線圖上包含組合式 E2E 時,這值得關注。
