[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
์ด๋ฏธ์ง ๋๋ ๋น๋์ค์ ๋ํ ์์ ํ self-attention์ ๋น์ฉ์ด ๊ณผ๋ํฉ๋๋ค. ์ด์ฐจ ์ฆ๊ฐ ์์ด Transformer์ ํํ๋ ฅ์ ์ ์งํ๋ ค๋ฉด?
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
Axial attention์ Transformer๋ฅผ ๊ณ ์ฐจ์ ๋ฐ์ดํฐ์ ๋ํด ๋ค๋ฃจ๊ธฐ ์ฝ๊ฒ ์ ์งํ๋ ์ฐ์ํ ์์ด๋์ด ์ค ํ๋์ ๋๋ค: ํ ๋ฒ์ ๋ชจ๋ ํฝ์ ์ด๋ ๋ชจ๋ ์๊ฐ-์ฃผํ์ ๋น์ ์ฃผ๋ชฉํ๋ ๋์ , ํ ๋ฒ์ ํ ์ถ์ ๋ฐ๋ผ ์ฃผ๋ชฉํฉ๋๋ค.
[๋กฑ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
์ด ๋ ผ๋ฌธ์ ์ ๋ก์ท ์์ฑ ํด๋ก๋์ ์ค์ฉ์ ์ผ๋ก ๋ง๋ ์ฐ๊ตฌ์ ๋๋ค: ์์ฒ ๊ฐ์ ๋ ธ์ด์ฆ๊ฐ ๋ง๊ณ ์ ์ฌ๋ณธ์ด ์๋ ์์ฑ์ผ๋ก ํ๋ณ์ ๊ฒ์ฆ ์์ ์์ speaker encoder๋ฅผ ํ์ตํ ํ, ๊ทธ ์๋ฒ ๋ฉ์ Tacotron 2๋ก
[์ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
ํ๋ ์ ๋ก์ท ์์ฑ ํด๋ก๋ ๋ฌผ๊ฒฐ์ ์์ํ Google ๋ ผ๋ฌธ์ ์๋ฆ๋ต๊ฒ ๊น๋ํ ์ํคํ ์ฒ๋ฅผ ๊ฐ์ง๊ณ ์์ต๋๋ค: verification์ ํ์ต๋ speaker encoder, ํ ์คํธ์ speaker ์๋ฒ ๋ฉ์
[๋กฑ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์ฌ์ฉํ Speech-to-Text Encoder-Decoder Models์ Pre-training
๋๋ถ๋ถ์ speech pretraining์ encoder ์ธก๋ฉด์ ์ง์คํ์ต๋๋ค: wav2vec, HuBERT, WavLM, ํ์ง๋ง sequence-to-sequence ASR์ pretrained decoder๋ ํ์ํฉ๋๋ค.
[์ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์ฌ์ฉํ Speech-to-Text Encoder-Decoder Models์ Pre-training
wav2vec 2.0 ๊ฐ์ Self-supervised pretraining์ ํ๋ฅญํ speech encoder๋ฅผ ์ ๊ณตํ์ต๋๋ค, ํ์ง๋ง ์ ์ฒด encoder-decoder ASR ์์คํ ์ ์ํ๋ฉด, decoder๋ ์ฌ์ ํ ์ฒ์๋ถํฐ ์์ํ์ต๋๋ค.
[๊ธด ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning
์ธ๊ฐ์ด ๋ ์ด๋ธ์ ์ง์ ํ ๋จ ํ๋์ ์์ ์์ด ์์ ๋ณ NLP ๋ชจ๋ธ์ ํ์ต์ํฌ ์ ์๋ค๋ฉด ์ด๋จ๊น์? "Towards Zero-Label Language Learning"์ ์ด ์ง๋ฌธ์ ๊ฐํ๊ฒ ์ ๊ธฐํฉ๋๋ค.
[์งง์ ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning
์๊ฐ์์ ๋ค์ฌ ์ฃผ์์ ์ง์ ํ ๋ ์ด๋ธ๋ ๋ฐ์ดํฐ๊ฐ ์ ๋ง๋ก ํ์ํ์ง ์๋ค๋ฉด ์ด๋จ๊น์?
