[Long Review] 'GShard': Scaling Giant Models with Conditional Computation and Automatic Sharding

Tutorials

[Long Review] 'GShard': 조건부 계산 및 자동 샤딩을 통한 거대 모델 확장

Transformer를 천억 매개변수 이상으로 확장하는 것은 철학적으로 빠릅니다. 모든 토큰에 대해 전체 네트워크를 활성화합니까, 아니면 각 토큰을 실제로 확인해야 하는 전문가에게 전달합니까?

Transformer를 천억 매개변수 이상으로 확장하는 것은 철학적으로 빠릅니다. 모든 토큰에 대해 전체 네트워크를 활성화합니까, 아니면 각 토큰을 실제로 확인해야 하는 전문가에게 전달합니까? GShard는 단일 프로그램, 다중 데이터 XLA 컴파일러가 수천 개의 TPU 코어에 걸쳐 6,000억 매개변수의 다국어 번역 모델을 배치할 수 있도록 하는 자동 샤딩 주석 시스템과 희소 전문가 혼합 레이어를 결합한 Google의 획기적인 답변입니다.

이 긴 리뷰에서는 상위 2개 게이팅, 보조 로드 밸런싱 손실, GShard를 작동시키는 주석 기반 병렬 처리 및 MoE 아키텍처를 업계 로드맵에 추가하는 번역 품질 향상에 대해 설명합니다. 선형 컴퓨팅 폭발 없이 확장되는 MoE 음성 기반 모델 또는 다국어 ASR를 고려 중인 음성 AI 팀을 위해 GShard는 나중에 Switch Transformer, GLaM 및 최신 음성 MoE 작업에서 빌린 어휘를 설정하는 논문입니다. 아키텍처 미래에 스파스 확장이 필요한 경우 한 시간을 차단하세요.