Microsoft+ESPnet、Google、VCTK、ICASSP のオープンソース大規模音声モデルのレビューSDK
主要なAIラボはすべてASR用のオープンソース大規模音声モデルをリリースしており、本番環境に適切なものを選択することが本当の決定事項になっています。
主要なAIラボはすべてASR用のオープンソース大規模音声モデルをリリースしており、本番環境に適切なものを選択することが本当の決定事項になっています。このレビューは大きなプレイヤーを並べて比較します:OpenAIの Whisper、GoogleのUSM隣接リリース、MetaのMMS と wav2vec 2.0 系統、そしてNvidiaの NeMo ファミリー(Conformer、Parakeet、Canary)。目標は、音声製品を出荷するチームに実際に重要な軸全体で正直な比較を行うことです — リアルなオーディオの精度、言語カバレッジ、レイテンシ、ライセンス、微調整の人間工学、そして各スタック周辺のコミュニティのサイズ。
リーダーボード数値を列挙するのではなく、このセグメントは各モデルがどこで力を発揮し、どこで静かに失敗するかに焦点を当てています:長形式の転写、コード切り替え、ドメイン適応、ストリーミング、そしてそれらを大規模に実行するための実際のコスト。また、タイムスタンプやhot-word biasing が必要な場合、エンドツーエンドの Transformer デコーダーと CTC スタイルのアーキテクチャ間のトレードオフについても注記しています。インハウスパイプライン向けのオープンソースASR基盤モデルを評価している場合、このまとめはGPU時間を費やしてそれら全部を自分でベンチマークする前の、確実な開始地点となります。
