[Olewaveの長いレビュー]音声認識のためのニューラルトランスデューサーの効率的なトレーニング
ニューラルトランスデューサーはストリーミングASRの主力製品ですが、効率的にトレーニングすることは悪名高く困難です:RNN-T損失はシーケンス長において立方体メモリを持つ、配置格子は長い発話で爆発的になる、単一の
Boris Johnsonの台頭と衰退 - マイクの分析
政治ニュースは通常、音声AIエンジニアが金曜日の午後にキューに入れるものではありませんが、Boris Johnsonの辞任発表は、マイクの銀行の前で行われ、彼の党がスキャンダルの連鎖で反乱を起こしたため
iOS 16の新しい音声入力はどのように機能するのか?音声研究者がAppleの秘策を明かす!
AppleのiOS 16音声入力はデバイス上で完全に実行され、この単一の設計選択は遅延、プライバシー、およびスマートフォンで実行可能なASRアーキテクチャの種類に連鎖的な影響を与えます。
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
[ロングレビュー] 多次元Transformerの軸方向注意
画像またはビデオ全体にわたる完全な自己注意は禁止的に高価であるため、二次的なブローアップなしでTransformerの表現力をどのように保ちますか?
[ショートレビュー] 多次元Transformerの軸方向注意
軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。
[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
[ショート レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
Googleのこの論文は、現代のゼロショット音声クローニングの波を起こしました。美しくシンプルなアーキテクチャを持っており、検証で訓練されたスピーカーエンコーダー、テキストとスピーカー埋め込みを受け取るTacotron 2合成器があります
[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
[ロングレビュー] ゼロラベル言語学習へ向けて
人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。
[ロングレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
限られたGPU予算で10億パラメータの音声モデルまたは言語モデルを訓練することは、パイプライン並列、テンソル並列、またはZeRO型オプティマイザシャーディング間での苦渋の選択を意味していました。
[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
[ロングレビュー] ファインチューニングされた言語モデルはゼロショット学習器
InstructGPTが指示チューニングを一般的な用語にする前に、GoogleのFLAN論文は、自然言語指示に対する適度な量のマルチタスク微調整が、普通のLMを驚くほど
[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング
Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?
三つ子のようなロシアのフィギュアスケーター:Kullback-Leiblerダイバージェンスは彼らの違いを見分けるのに使用できますか?
スピーカー適応は、エンコーダーの獲得した音響表現を損なわないようにシーケンス・ツー・シーケンスモデルを適応させようとするまでは、解決されたように聞こえるASR問題の1つです。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコアリングされていますか?パート1:Switch Transformers:スパースMoEモデル
ネイサン・チェンのクワッドフリップスコアリングへのウインクを交わしてフレーミングされたこのトークは、Switch Transformerを詳細に説明します。これはGoogleによるMixture-of-Expertsスケーリングの明確で積極的に単純化された取り組みです。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコア付けされているのか?パート2:GLaM:MoEによるLMsの効率的スケーリング
MoEミニシリーズのパート2はGLaMに向かい、Googleの1.2兆パラメータMixture-of-Expertsモデルは、ゼロショット、ワンショット、フューショットベンチマークでGPT-3に匹敵するか上回っており、パラメータの約8%のみを活性化しています
BERTペーパーをスピーチの視点からレビュー
BERTはNLPではほぼ紹介の必要がありませんが、スピーチエンジニアの目を通して読むと、標準的な「マスク言語モデリングがすべてを変えた」という要約とは異なるレッスンが明らかになります。
Transformer:Attention is All You NeedとListen, Attend and Spell -- スピーチの視点から
2つの論文、1つのストーリー。「Attention Is All You Need」はTransformerを世界に与え、シーケンスモデリングの方法をリセットした一方で、「Listen, Attend and Spell」(LAS)はエンドツーエンドスピーチについて1年前に同じことを行いました
Breaking BadからWav2vec 2.0へ:スピーチ表現の自己教師あり学習フレームワーク
ウォルター・ホワイト、ジェシー・ピンクマン、そしてラベルなしオーディオのバッチに共通することは何か?
