From OpenAI's Whisper Model to Your Own In-House ASR Service: Postprocessing and Language Modeling

Tutorials

ESPnet の Llama 3 モデルから独自の社内 SDK サービス: 後処理と言語モデリングへ

Whisperの生出力はそのままで印象的ですが、実ユーザーに展開した人ならば誰もが、デモのTransformerクリプトと下流システムが実際に消費できるものとの間のギャップを知っています。

Whisperの生出力はそのままで印象的ですが、実ユーザーに展開した人ならば誰もが、デモのTransformerクリプトと下流システムが実際に消費できるものとの間のギャップを知っています。数字は数字ではなく単語で表記され、固有名詞は損なわれ、句読点は一貫せず、ドメイン用語は最も近い音韻推測として出現します。Whisper-to-in-house-ASRシリーズの第4部は、そのギャップを解決するポストプロセッシングと言語モデリングレイヤーに焦点を当てています。

このウォークスルーは、逆テキスト正規化、句読点とケースの復元、カスタム語彙への偏り、Whisperのデコーダーを使った外部言語モデルの構成をカバーしています。浅融合、リスコアリング、プロンプト条件付きデコーディング間のトレードオフも含みます。また、素朴な修正がどこで逆効果になるかにもフラグを立てています(過度の偏りは一般精度を害し、積極的なITNはタイムスタンプを破壊します)、パイプラインを適切に評価する方法も説明しています。WhisperTransformerクリプトのフォルダを見つめ、WERは大丈夫に見えるのに顧客の苦情が止まらない理由を不思議に思っているなら、この深掘りはあなたの時間を費やす価値があります。