Tutorials
Nathan Chen์ 4 Flip์ด Mixture-of-Experts๋ก ์ฑ์ ๋๋์? Part 2: GLaM:Efficient Scaling of LMs with MoE
MoE ๋ฏธ๋ ์๋ฆฌ์ฆ์ Part 2๋ GLaM์ผ๋ก ์ด์ ์ ๋ง์ถฅ๋๋ค. Google์ 1.2์กฐ-ํ๋ผ๋ฏธํฐ Mixture-of-Experts ์ธ์ด ๋ชจ๋ธ๋ก, ์ ๋ก-์ท, ์-์ท, ๊ทธ๋ฆฌ๊ณ ํจ-์ท ๋ฒค์น๋งํฌ์์ GPT-3๊ณผ ๋๋ฑํ๊ฑฐ๋ ๋ฅ๊ฐํ๋ฉฐ ํ ํฐ๋น ์ฝ 8%์ ํ๋ผ๋ฏธํฐ๋ง ํ์ฑํํฉ๋๋ค
