Why word timestamps generated by OpenAI Whisper are not accurate? How to make them accurate again?

Tutorials

ESPnetWhisper によって生成されたワード タイムスタンプが正確ではないのはなぜですか?それらを再度正確にするにはどうすればよいでしょうか?

Whisper に単語のタイムスタンプを要求すると、数字が返されます。しかし、カラオケ、キャプション、または吹き替えのためにそれらを実際の音声と並べようとしたことがあるなら、タイムスタンプがずれたり、間違った境界にスナップしたり、場合によってはずれたりすることをご存知でしょう。

Whisper に単語のタイムスタンプを要求すると、数字が返されます。しかし、カラオケ、キャプション、または吹き替えでそれらを実際の音声と並べようとしたことがあるなら、タイムスタンプがずれたり、間違った境界にスナップしたり、時には存在しない単語の区切りが幻覚のように見えることをご存知でしょう。この講演では、アーキテクチャ レベルでそれが起こる理由と、それに対して現実的に何ができるかを説明します。

短いバージョン: クロスエントロピーでトレーニングされたエンドツーエンドの Transformer デコーダーは、次のトークンを時間内に揃えるのではなく、予測するように最適化されます。クロスアテンションの重みと DTW ベースのトリックは、第一級の目標として位置合わせを学習したことのないモデルに基づくヒューリスティックです。次に、ウォークスルーでは、提供されている修正を調査します。ヒューリスティック後処理ツール (ほとんどがベンチマークされておらず、回避するのが最善です)、電話ベースの強制アライメント (より優れていますが、発音辞書と追加の計算が必要です)、Whisper のTransformerクリプトと CTC または強制アライメント モデルを組み合わせるハイブリッド アプローチです。字幕、吹き替え、音声編集、音声分析など、タイミングが重要な製品を出荷する場合、これは本番環境での Whisper のタイムスタンプを信頼する前に重要なコンテキストです。