GoogleのUniversal Speech Modelが100以上の言語でOpenAIのWhisper Modelを上回る
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。このレビューは、どのようにしてそれを実現したかを掘り下げています。答えは単なるコンピュートの増加ではありません。USMは、300以上の言語にまたがる1200万時間のラベルなしの多言語データセットに依存し、その後、ランダム射影量子化をSSL目的のための軽量な量子化器として使用し、音声テキストモダリティマッチングを使用して、はるかに小さなラベル付きセットでの教師あり微調整にきれいに橋渡しします。
このチュートリアルは、完全な事前訓練レシピ、RPQがコードブックを学習する必要なくSSL目的の軽量な量子化器として機能する理由、および音声とテキストの表現をウェブスケールでペアのデータを要求することなくどのように調整するか、モダリティマッチングについて説明しています。利点は、低リソース言語の長いテールにおいてドメイン内とドメイン外の両方で、多言語ASRおよび音声ツーテキスト翻訳への下流タスクに一般化する単一のエンコーダーです。これはまさにWhisperの完全な教師あり方法が緊張し始めるところです。あなたの製品が上位20の言語を超えてユーザーにサービスを提供する必要がある場合、これは多言語音声スタックにコミットする前に理解する価値がのあるモデルアーキテクチャです。
