[10分] OpenAIのWhisper APIがChatGPTほど優れていない理由を説明する
Whisperは大きな話題となりましたが、GPT-3がNLPを変革したようにASRを変えることはできず、この10分間のレビューでは、その理由が論文そのものに組み込まれていると主張しています。
Whisperは大きな話題となりましたが、GPT-3がNLPを変革したようにASRを変えることはできず、この10分間のレビューでは、その理由が論文そのものに組み込まれていると主張しています。このモデルは、ウェブからスクレイピングされた680,000時間の多言語マルチタスク教師ありデータで訓練され、アクセント、背景ノイズ、技術用語に対する堅牢性を大幅に改善しながら、英語への翻訳をボーナスとして追加しました。しかし、その飛躍はChatGPTがテキストに対して行ったことに比べて段階的に感じられました。
このビデオはその理由を掘り下げます:ウェブの文字起こしからの弱い教師ありデータはクリーンなラベル付きデータとは異なる失敗モードを持ち、ASRの上限は次トークン予測とは異なる方法で音響曖昧性によって設定され、モデルのゼロショット汎化はLLMのインコンテキスト学習のように積み重なりません。Whisperを微調整するか、NeMoまたはESPnetモデルに置き換えるか、次世代の音声基盤モデルを待つかを決定している人にとって、ここでのフレーミングは役に立ちます。本番環境でASRを配信する場合、5分の価値がある迅速で独自の見方です。
