OpenAI WhisperからあなたのASRサービス自社へ:名前エンティティ&ドメイン固有用語の認識
Whisperはそのままで印象的ですが、実際に本番環境にデプロイした人なら誰もが知っているとおり、固有名詞、製品名、医療用語、法的専門用語、およびドメイン語彙の長い尾部全体で失敗します
Whisperはそのままで印象的ですが、実際に本番環境にデプロイした人なら誰もが知っているとおり、固有名詞、製品名、医療用語、法的専門用語、およびドメイン語彙の長い尾部全体で失敗します。これはOpenAIの Whisper を本物の自社ASRサービスに変えるシリーズの第6部であり、その正確な問題に直接取り組んでいます—モデル全体を再トレーニングせずに、名前エンティティとドメイン固有の用語を確実に認識させる方法。
エピソードでは、カスタム語彙へのバイアスを認識する実践的なテクニック、デコードパスへのエンティティリストの統合、および汎用基礎モデルとあなたのドメインの専門用語を実際に理解するシステムの間の精度ギャップを閉じる方法を説明します。これはシリーズの以前の部分—概要、ROI分析、長音声およびストリーミング処理、後処理、外部言語モデリング、およびタイムスタンプの精度—に基づいており、本番対応パイプライン全体にうまく適合します。クラウドASR APIに固執するか、Whisper上に自分自身をロールするかを評価している場合、これは語彙の質問に答える部分です。
