[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation
Imagen๊ณผ DALL-E 2๊ฐ ์์ฑ ์ด๋ฏธ์ง๋ฅผ ์ํ ํ์ฐ์ ๊ธฐ๋ณธ๊ฐ์ผ๋ก ๋ง๋ค๊ธฐ ์ ์, ์ด Google Brain ๋ ผ๋ฌธ์ ์ดํ ๋ง์ ํ ์คํธ-์ด๋ฏธ์ง ์์คํ ์ด ์กฐ์ฉํ ์ฐจ์ฉํ cascaded diffusion ๋ ์ํผ๋ฅผ ์ ์ํ์ต๋๋ค: ์์
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation
Cascaded diffusion์ ๋ง์ ์ต์ ์์ฑ ์์ ์ ๊ธฐ์ ๋ฅผ ์ด๋ฃจ๋ ๋ค๋จ๊ณ ๋ ์ํผ์ ๋๋ค: ํ ๊ฐ์ diffusion ๋ชจ๋ธ๋ก ์์ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ ํ, ๊ณ ์ฃผํ ์ธ๋ถ
[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
์ด๋ฏธ์ง ๋๋ ๋น๋์ค์ ๋ํ ์์ ํ self-attention์ ๋น์ฉ์ด ๊ณผ๋ํฉ๋๋ค. ์ด์ฐจ ์ฆ๊ฐ ์์ด Transformer์ ํํ๋ ฅ์ ์ ์งํ๋ ค๋ฉด?
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
Axial attention์ Transformer๋ฅผ ๊ณ ์ฐจ์ ๋ฐ์ดํฐ์ ๋ํด ๋ค๋ฃจ๊ธฐ ์ฝ๊ฒ ์ ์งํ๋ ์ฐ์ํ ์์ด๋์ด ์ค ํ๋์ ๋๋ค: ํ ๋ฒ์ ๋ชจ๋ ํฝ์ ์ด๋ ๋ชจ๋ ์๊ฐ-์ฃผํ์ ๋น์ ์ฃผ๋ชฉํ๋ ๋์ , ํ ๋ฒ์ ํ ์ถ์ ๋ฐ๋ผ ์ฃผ๋ชฉํฉ๋๋ค.
[๋กฑ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
์ด ๋ ผ๋ฌธ์ ์ ๋ก์ท ์์ฑ ํด๋ก๋์ ์ค์ฉ์ ์ผ๋ก ๋ง๋ ์ฐ๊ตฌ์ ๋๋ค: ์์ฒ ๊ฐ์ ๋ ธ์ด์ฆ๊ฐ ๋ง๊ณ ์ ์ฌ๋ณธ์ด ์๋ ์์ฑ์ผ๋ก ํ๋ณ์ ๊ฒ์ฆ ์์ ์์ speaker encoder๋ฅผ ํ์ตํ ํ, ๊ทธ ์๋ฒ ๋ฉ์ Tacotron 2๋ก
[์ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
ํ๋ ์ ๋ก์ท ์์ฑ ํด๋ก๋ ๋ฌผ๊ฒฐ์ ์์ํ Google ๋ ผ๋ฌธ์ ์๋ฆ๋ต๊ฒ ๊น๋ํ ์ํคํ ์ฒ๋ฅผ ๊ฐ์ง๊ณ ์์ต๋๋ค: verification์ ํ์ต๋ speaker encoder, ํ ์คํธ์ speaker ์๋ฒ ๋ฉ์
[์ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์ฌ์ฉํ Speech-to-Text Encoder-Decoder Models์ Pre-training
wav2vec 2.0 ๊ฐ์ Self-supervised pretraining์ ํ๋ฅญํ speech encoder๋ฅผ ์ ๊ณตํ์ต๋๋ค, ํ์ง๋ง ์ ์ฒด encoder-decoder ASR ์์คํ ์ ์ํ๋ฉด, decoder๋ ์ฌ์ ํ ์ฒ์๋ถํฐ ์์ํ์ต๋๋ค.
[๊ธด ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning
์ธ๊ฐ์ด ๋ ์ด๋ธ์ ์ง์ ํ ๋จ ํ๋์ ์์ ์์ด ์์ ๋ณ NLP ๋ชจ๋ธ์ ํ์ต์ํฌ ์ ์๋ค๋ฉด ์ด๋จ๊น์? "Towards Zero-Label Language Learning"์ ์ด ์ง๋ฌธ์ ๊ฐํ๊ฒ ์ ๊ธฐํฉ๋๋ค.
[Short Review] ํ๋ จ ๋ฐ์ดํฐ ์ค๋ณต ์ ๊ฑฐ๊ฐ ์ธ์ด ๋ชจ๋ธ์ ๋ ์ข๊ฒ ๋ง๋ ๋ค
๋น์ ์ ์ธ์ด ๋ชจ๋ธ์ "์ผ๋ฐํ" ์ค ์ผ๋ง๋ ๋ง์ ๋ถ๋ถ์ด ์ค์ ๋ก๋ ๋จ์ํ ๋ฐ๋ณต์ผ๊น์?
