[EnCodecのレビュー]構成E2Eモデルを使用したRVQのトークンレベルのシーケンスラベリング
エンドツーエンドの SLU には一時的な余裕がありますが、配列ラベル付けを配列予測として扱うことは、数十年にわたるよく理解されたトークンレベルのタグ付け機構を静かに廃棄することになります。
エンドツーエンドの SLU には一時的な余裕がありますが、配列ラベル付けを配列予測として扱うことは、数十年にわたるよく理解されたトークンレベルのタグ付け機構を静かに廃棄することになります。このペーパーでは、E2E のシンプルさを維持しながらトークン レベルの定式化を提供し、CRF スタイルのグローバルに正規化された損失とコンポーネントごとのクリーンなパフォーマンス モニタリングを備えた構成的なエンドツーエンド SLU 設計を提案します。カスケードされた ASR と NLU パイプラインと直接 E2E を比較検討するチームにとって、これは実用的な中間パスです。
秘訣は、NLU タガーが実行される前に、音声をトークン レベルの表現に変換する ASR でトレーニングされた中間デコーダーを挿入することです。これにより、ハード カスケードのエラー伝播税を支払うことなく、事前トレーニングされた ASR および NLU コンポーネントとの互換性を継承できます。 SLU ベンチマーク全体の固有表現認識では、構成モデルがカスケード E2E ベースラインと直接 E2E ベースラインの両方を上回りました。この内容では、アーキテクチャ、トレーニング信号の設計、グローバルに正規化された CRF 損失がどのように問題に反映されるか、実際に運用環境でデバッグする必要がある場合にコンポーネントごとのパフォーマンス監視が重要である理由について詳しく説明します。音声アシスタント、コールセンター分析、またはスロット充填と意図検出が ASR の上に位置する製品を出荷している場合、構成的な E2E がロードマップにあるときにこれに注目する価値があります。
