[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?FSDPはモデルのパラメータをデータ並列ワーカー全体でシャード化し、各マイクロバッチ計算をローカルに保ち、GPU メモリが逼迫したときはオプションでCPUにスピルします。シャーディングが均一で通信が計算とオーバーラップするため、手動で調整されたパイプライン並列と同等の性能を維持しながら、概念モデルは驚くほどシンプルなままです。
このショートレビューはFairScale実装とFacebookの自社NLPおよびビジョンワークロードでの初期成功を簡潔にまとめています。wav2vec 2.0、HuBERT、またはLLMベースのTTSをより大規模にプッシュしているボイスAIエンジニア向けに、FSDPは実質的なメモリ節約を伴う低摩擦のアップグレードパスです。FSDPが何をするかのクイックツアー、および次のPyTorch訓練設定ですでにデフォルトである可能性が高い理由については、再生をクリックしてください。
