Tag: voice-ai

News
From OpenAI Whisper to Your In-House ASR Service: Recognizing Name Entities & Domain-Specific Terms
Tutorials

OpenAI Whisper์—์„œ ์ž์ฒด ASR ์„œ๋น„์Šค๋กœ: ์ด๋ฆ„ ์—”ํ‹ฐํ‹ฐ ๋ฐ ๋„๋ฉ”์ธ๋ณ„ ์šฉ์–ด ์ธ์‹

Whisper๋Š” ์ฆ‰์‹œ ์ธ์ƒ์ ์ด์ง€๋งŒ, ์‹ค์ œ๋กœ ํ”„๋กœ๋•์…˜์— ๋ฐฐํฌํ•œ ์‚ฌ๋žŒ์ด๋ผ๋ฉด ๋ˆ„๊ตฌ๋‚˜ ๊ณ ํ†ต์„ ์•Œ๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค: ๊ณ ์œ ๋ช…์‚ฌ, ์ œํ’ˆ ์ด๋ฆ„, ์˜๋ฃŒ ์šฉ์–ด, ๋ฒ•๋ฅ  ์šฉ์–ด, ๊ทธ๋ฆฌ๊ณ  ๋„๋ฉ”์ธ ์–ดํœ˜์˜ ์ „์ฒด ๊ธด ๊ผฌ๋ฆฌ๋ฅผ ์ž˜๋ชป ์ฒ˜๋ฆฌํ•ฉ๋‹ˆ๋‹ค

12์›” 20, 2024ยท 1 min read
Olewave at ICASSP 2024
Events

ICASSP 2024์—์„œ์˜ Olewave

์šฐ๋ฆฌ๋Š” ์„œ์šธ์˜ IEEE ICASSP 2024์˜ ํ›„์›์‚ฌ์ด์ž ์ „์‹œ์—…์ฒด์˜€์œผ๋ฉฐ, ๋‹น์‚ฌ์˜ ์„ค๋ฆฝ์ž์ด์ž CEO์ธ Wei Chu๊ฐ€ ์•ผ์ƒ ์›น ์†Œ์‹ฑ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ ์Œ์„ฑ ๋ชจ๋ธ ํ›ˆ๋ จ์— ๋Œ€ํ•œ ์ดˆ๋Œ€ ์—ฐ์„ค์„ ์ง„ํ–‰ํ–ˆ์Šต๋‹ˆ๋‹ค.

4์›” 19, 2024ยท 3 min read
Variational Autoencoder (VAE) and Reparameterization Trick - Revisiting the Classic Generative Model
Tutorials

๋ณ€๋ถ„ ์ž๋™์ธ์ฝ”๋”(VAE) ๋ฐ ์žฌ๋งค๊ฐœ๋ณ€์ˆ˜ํ™” ํŠธ๋ฆญ - ๊ณ ์ „ ์ƒ์„ฑ ๋ชจ๋ธ ์žฌ๊ฒ€ํ† 

ํ™•์‚ฐ ๋ชจ๋ธ์ด ๋‚˜์˜ค๊ธฐ ์ „์—, ์ •๊ทœํ™” ํ๋ฆ„์ด ๋‚˜์˜ค๊ธฐ ์ „์—, ์ž ์žฌ ํ™•์‚ฐ ๋ชจ๋ธ์ด ์กฐ์šฉํžˆ VAE ์ธ์ฝ”๋”๋ฅผ ๋ชจ๋“  ์ง„์ง€ํ•œ ์ƒ์„ฑ ์Šคํƒ์— ๊ตฌ์ถ•ํ•˜๊ธฐ ์ „์— โ€” Kingma์™€ Welling์˜ 2013๋…„ ๋…ผ๋ฌธ์ด ๋ณ€๋ถ„ ์ž๋™์ธ์ฝ”๋”๋ฅผ ์†Œ๊ฐœ

2์›” 24, 2024ยท 1 min read
A Review of Microsoft+OpenAI, Google, Meta, and Nvidia's Open Source Large Speech Models for ASR
Tutorials

Microsoft+OpenAI, Google, Meta, ๋ฐ Nvidia์˜ ์˜คํ”ˆ ์†Œ์Šค ๋Œ€๊ทœ๋ชจ ์Œ์„ฑ ๋ชจ๋ธ ๊ฒ€ํ† (ASR์šฉ)

๋ชจ๋“  ์ฃผ์š” AI ์—ฐ๊ตฌ์†Œ๋Š” ์ด์ œ ASR์šฉ ์˜คํ”ˆ ์†Œ์Šค ๋Œ€๊ทœ๋ชจ ์Œ์„ฑ ๋ชจ๋ธ์„ ์ถœ์‹œํ–ˆ์œผ๋ฉฐ, ํ”„๋กœ๋•์…˜์šฉ์œผ๋กœ ์˜ฌ๋ฐ”๋ฅธ ๋ชจ๋ธ์„ ์„ ํƒํ•˜๋Š” ๊ฒƒ์ด ์‹ค์ œ ๊ฒฐ์ •์ด ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

2์›” 9, 2024ยท 1 min read
Tycho:a tookit for building high-ROI in-house speech-related services (ASR/TTS/Translation):Overview
Tutorials

Tycho: ๋†’์€ ROI ์ž์ฒด ์Œ์„ฑ ๊ด€๋ จ ์„œ๋น„์Šค(ASR/TTS/๋ฒˆ์—ญ) ๊ตฌ์ถ•์„ ์œ„ํ•œ ํˆดํ‚ท: ๊ฐœ์š”

์ž์ฒด ASR, TTS, ๋˜๋Š” ์Œ์„ฑ ๋ฒˆ์—ญ ์„œ๋น„์Šค๋ฅผ ์›ํ•˜๋Š” ๋Œ€๋ถ€๋ถ„์˜ ํŒ€์€ ๋™์ผํ•œ ๋ณต์žกํ•œ ์„ ํƒ์— ์ง๋ฉดํ•ฉ๋‹ˆ๋‹ค: ESPnet, NeMo, k2, HuggingFace์˜ ์กฐ๊ฐ๋“ค์„ ๋ถ™์ด๊ฑฐ๋‚˜, ๋ชจ๋“  ๊ฒƒ์„ ํด๋ผ์šฐ๋“œ API์— ๋„˜๊ธฐ๊ณ  ๋ถ„๋‹น ๋น„์šฉ์„ ์ง€๋ถˆ

1์›” 26, 2024ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Postprocessing and Language Modeling
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์‹ ์˜ ์ž์ฒด ASR ์„œ๋น„์Šค๋กœ: ํ›„์ฒ˜๋ฆฌ ๋ฐ ์–ธ์–ด ๋ชจ๋ธ๋ง

์›๋ณธ Whisper ์ถœ๋ ฅ์€ ๊ธฐ๋ณธ ์ƒํƒœ์—์„œ ์ธ์ƒ์ ์ด์ง€๋งŒ, ์‹ค์ œ ์‚ฌ์šฉ์ž์—๊ฒŒ ๋ฐฐํฌํ•œ ๋ชจ๋“  ์‚ฌ๋žŒ์€ ๋ฐ๋ชจ ํŠธ๋žœ์Šคํฌ๋ฆฝํŠธ์™€ ๋‹ค์šด์ŠคํŠธ๋ฆผ ์‹œ์Šคํ…œ์ด ์‹ค์ œ๋กœ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ๊ฒƒ ์‚ฌ์ด์˜ ๊ฐ„๊ฒฉ์„ ์•Œ๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

1์›” 12, 2024ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Long Audio and Streaming (Part 3)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์‹ ์˜ ์ž์ฒด ASR ์„œ๋น„์Šค๋กœ: ๊ธด ์˜ค๋””์˜ค ๋ฐ ์ŠคํŠธ๋ฆฌ๋ฐ (Part 3)

Whisper๋Š” 30์ดˆ ์ฒญํฌ๋กœ ํ•™์Šต๋˜์—ˆ์œผ๋ฉฐ, 2์‹œ๊ฐ„ ํŒŸ์บ์ŠคํŠธ๋ฅผ ์ž…๋ ฅํ•˜๊ฑฐ๋‚˜ ๋ผ์ด๋ธŒ ์บก์…˜ ํŒŒ์ดํ”„๋ผ์ธ์— ์—ฐ๊ฒฐํ•˜๋ ค๊ณ  ํ•  ๋•Œ ํ•œ๊ณ„๋ฅผ ๋“œ๋Ÿฌ๋ƒ…๋‹ˆ๋‹ค.

12์›” 15, 2023ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: ROI (Return-on-Investment) (Part 2)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์‹ ์˜ ์ž์ฒด ASR ์„œ๋น„์Šค๋กœ: ROI (ํˆฌ์ž ์ˆ˜์ต๋ฅ ) (Part 2)

ASR์˜ ๊ตฌ์ถ• ๋Œ€ ๊ตฌ๋งค ์งˆ๋ฌธ์€ ์ผ๋ฐ˜์ ์œผ๋กœ ์ •ํ™•๋„ ๋Œ€ ํŽธ์˜์„ฑ์œผ๋กœ ํ”„๋ ˆ์ž„ํ™”๋˜์ง€๋งŒ, ์‹ค์ œ ๊ฒฐ์ • ์š”์†Œ๋Š” ์ œํ’ˆ ์ˆ˜๋ช… ๋™์•ˆ์˜ ROI์ž…๋‹ˆ๋‹ค.

12์›” 2, 2023ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Overview (Part 1)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์‹ ์˜ ์ž์ฒด ASR ์„œ๋น„์Šค๋กœ: ๊ฐœ์š” (Part 1)

OpenAI๊ฐ€ Whisper๋ฅผ ์˜คํ”ˆ์†Œ์Šค๋กœ ๊ณต๊ฐœํ–ˆ์„ ๋•Œ, ์ž์ฒด ASR ์„œ๋น„์Šค๊ฐ€ ์–ด๋–ป๊ฒŒ ๋ณด์ด๋Š”์ง€์— ๋Œ€ํ•œ ๊ธฐ์ค€์„ ์„ ์กฐ์šฉํžˆ ์žฌ์„ค์ •ํ–ˆ์Šต๋‹ˆ๋‹ค.

11์›” 3, 2023ยท 1 min read
Why word timestamps generated by OpenAI Whisper are not accurate? How to make them accurate again?
Tutorials

OpenAI Whisper๊ฐ€ ์ƒ์„ฑํ•œ ๋‹จ์–ด ํƒ€์ž„์Šคํƒํ”„๊ฐ€ ์ •ํ™•ํ•˜์ง€ ์•Š์€ ์ด์œ ๋Š”? ๋‹ค์‹œ ์ •ํ™•ํ•˜๊ฒŒ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ?

Whisper์— ๋‹จ์–ด ํƒ€์ž„์Šคํƒํ”„๋ฅผ ์š”์ฒญํ•˜๋ฉด ์ˆซ์ž๊ฐ€ ๋ฐ˜ํ™˜๋ฉ๋‹ˆ๋‹ค โ€” ํ•˜์ง€๋งŒ ์‹ค์ œ ์˜ค๋””์˜ค์™€ ๋งž์ถฐ๋ณด๋ ค๊ณ  ์‹œ๋„ํ•œ ๊ฒฝํ—˜์ด ์žˆ๋‹ค๋ฉด, ๋…ธ๋ž˜๋ฐฉ, ์ž๋ง‰, ๋”๋น™์„ ์œ„ํ•ด ๋“œ๋ฆฌํ”„ํŠธ๊ฐ€ ๋ฐœ์ƒํ•˜๊ณ  ์ž˜๋ชป๋œ ๊ฒฝ๊ณ„๋กœ ์Šค๋ƒ…๋˜๋ฉฐ ๊ฐ€๋”์€

10์›” 20, 2023ยท 1 min read
Speech Generative AI: VoiceBox by Meta AI (also Flow Matching and Neural ODE)
Tutorials

์Œ์„ฑ ์ƒ์„ฑ AI: Meta AI์˜ VoiceBox(Flow Matching๊ณผ Neural ODE๋„)

์ˆ˜๋…„ ๋™์•ˆ ์Œ์„ฑ ์ƒ์„ฑ์€ ๊ทœ๋ชจ์™€ ์ผ๋ฐ˜์„ฑ ์ธก๋ฉด์—์„œ ํ…์ŠคํŠธ ๋ฐ ์ด๋ฏธ์ง€ ์ƒ์„ฑ์— ๋’ค๋–จ์–ด์กŒ์Šต๋‹ˆ๋‹ค โ€” ๋ชจ๋“  ์ž‘์—…์€ ์ž์ฒด ๋งž์ถคํ˜• ๋ชจ๋ธ์„ ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค.

9์›” 14, 2023ยท 1 min read
I-JEPA: Yannn LeCun's First 'World Model' for Computer Vision
Tutorials

I-JEPA: Yann LeCun์˜ ์ฒซ ๋ฒˆ์งธ '์„ธ๊ณ„ ๋ชจ๋ธ' ์ปดํ“จํ„ฐ ๋น„์ „์šฉ

Yann LeCun์€ ์ˆ˜๋…„ ๋™์•ˆ ์ƒ์„ฑํ˜• ์‚ฌ์ „ ํ›ˆ๋ จ์ด ์„ธ๊ณ„๋ฅผ ์ดํ•ดํ•˜๋Š” ๊ธฐ๊ณ„๋ฅผ ๋งŒ๋“ค๊ธฐ ์œ„ํ•œ ์ž˜๋ชป๋œ ๋ฒ ํŒ…์ด๋ผ๊ณ  ์ฃผ์žฅํ•ด์™”์Šต๋‹ˆ๋‹ค.

6์›” 17, 2023ยท 1 min read
LoRA: allow a high school student to train Large Language Model (GPT-3) with a gaming graphics card
Tutorials

LoRA: ๊ณ ๋“ฑํ•™์ƒ๋„ ๊ฒŒ์ด๋ฐ ๊ทธ๋ž˜ํ”ฝ ์นด๋“œ๋กœ ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(GPT-3)์„ ํ›ˆ๋ จํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•˜๋‹ค

175B ํŒŒ๋ผ๋ฏธํ„ฐ GPT-3์˜ ์ „์ฒด ๋ฏธ์„ธ ์กฐ์ •์€ ๊ฑฐ์˜ ๋ชจ๋“  ์‚ฌ๋žŒ์—๊ฒŒ ํ˜„์‹ค์ ์ด์ง€ ์•Š์Šต๋‹ˆ๋‹ค โ€” ์ €์žฅ ๊ณต๊ฐ„๋งŒ์œผ๋กœ๋„ ๋ถˆ๊ฐ€๋Šฅํ•˜๋ฉฐ, GPU๋Š” ๋งํ•  ๊ฒƒ๋„ ์—†์Šต๋‹ˆ๋‹ค.

6์›” 3, 2023ยท 1 min read
A Review of SpeechT5: Introducing Google's T5 into Speech (ASR, TTS, SID, ...) Tasks
Tutorials

SpeechT5 ๋ฆฌ๋ทฐ: ์Œ์„ฑ(ASR, TTS, SID, ...) ์ž‘์—…์— Google์˜ T5 ๋„์ž…ํ•˜๊ธฐ

T5๋Š” ๋‹จ์ผ ์ธ์ฝ”๋”-๋””์ฝ”๋” ์‚ฌ์ „ ํ›ˆ๋ จ ๋ฐฉ์‹ ์•„๋ž˜์—์„œ ํ…์ŠคํŠธ-ํ…์ŠคํŠธ ์ž‘์—…์„ ํ†ตํ•ฉํ–ˆ์œผ๋ฉฐ NLP์˜ ํ•ต์‹ฌ ๋„๊ตฌ๊ฐ€ ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

5์›” 20, 2023ยท 1 min read
Review of HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis
Tutorials

HiFi-GAN ๋ฆฌ๋ทฐ: ํšจ์œจ์ ์ด๊ณ  ๊ณ ์ถฉ์‹ค๋„ ์Œ์„ฑ ํ•ฉ์„ฑ์„ ์œ„ํ•œ ์ƒ์„ฑ ์ ๋Œ€ ๋„คํŠธ์›Œํฌ

์˜ค๋žซ๋™์•ˆ ์‹ ๊ฒฝ ๋ณด์ฝ”๋”๋Š” ์„ ํƒ์„ ๊ฐ•์š”ํ–ˆ์Šต๋‹ˆ๋‹ค: WaveNet๊ณผ ๊ฐ™์€ ์ž๋™ํšŒ๊ท€ ๋ชจ๋ธ์€ ์•„๋ฆ„๋‹ค์šด ์˜ค๋””์˜ค๋ฅผ ์ œ๊ณตํ–ˆ์ง€๋งŒ ๊ณ ํ†ต์Šค๋Ÿฝ๊ฒŒ ๋А๋ ธ๊ณ , GAN ๊ธฐ๋ฐ˜ ํŒŒํ˜• ์ƒ์„ฑ๊ธฐ๋Š” ๋น ๋ฅด์ง€๋งŒ ๋ˆˆ์— ๋„๊ฒŒ ๋‚ฎ์€ ํ’ˆ์งˆ์ด์—ˆ์Šต๋‹ˆ๋‹ค.

4์›” 22, 2023ยท 1 min read
In-depth Review of Google's SoundStream: An End-to-End Neural Audio Codec
Tutorials

Google์˜ SoundStream ์‹ฌ์ธต ๋ฆฌ๋ทฐ: ์—”๋“œ-ํˆฌ-์—”๋“œ ์‹ ๊ฒฝ ์˜ค๋””์˜ค ์ฝ”๋ฑ

์‹ ๊ฒฝ ์ฝ”๋ฑ์€ ์กฐ์šฉํžˆ ํ˜„๋Œ€ ์ƒ์„ฑ ์˜ค๋””์˜ค์˜ ๊ธฐ์ดˆ ๊ณ„์ธต์ด ๋˜์—ˆ๊ณ , SoundStream์€ ์‹œ์ž‘์„ ์‹ ํ˜ธํ•œ ๋…ผ๋ฌธ ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค.

4์›” 8, 2023ยท 1 min read
In-depth Review of VALL-E: Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers
Tutorials

VALL-E์˜ ์‹ฌ์ธต ๋ฆฌ๋ทฐ: ์‹ ๊ฒฝ ์ฝ”๋ฑ ์–ธ์–ด ๋ชจ๋ธ์ด ์˜์ƒท ํ…์ŠคํŠธ ์Œ์„ฑ ํ•ฉ์„ฑ๊ธฐ

3์ดˆ ์ฐธ๊ณ  ํด๋ฆฝ์œผ๋กœ๋ถ€ํ„ฐ์˜ ์˜์ƒท TTS๋Š” VALL-E๊ฐ€ ์ถœ์‹œ๋  ๋•Œ๊นŒ์ง€ ๋ถˆ๊ฐ€๋Šฅํ•ด ๋ณด์˜€์ง€๋งŒ, ์ด ์‹ฌ์ธต ๋ฆฌ๋ทฐ๋Š” Microsoft๊ฐ€ ์ •ํ™•ํžˆ ์–ด๋–ป๊ฒŒ ์ด๋ฅผ ๋‹ฌ์„ฑํ–ˆ๋Š”์ง€๋ฅผ ์ƒ์„ธํžˆ ์„ค๋ช…ํ•ฉ๋‹ˆ๋‹ค.

2์›” 4, 2023ยท 1 min read
Non Collision Mispronunciation Addition (NCMA) for Accented ASR
Tutorials

Non Collision Mispronunciation Addition (NCMA) for ์‚ฌํˆฌ๋ฆฌ ASR

์‚ฌํˆฌ๋ฆฌ์™€ ๋น„์›์–ด๋ฏผ ์Œ์„ฑ์€ ๋ฐœ์Œ ์‚ฌ์ „์„ ํŒŒ๊ดดํ•˜์—ฌ ์Œ์„ฑ ๋ชจ๋ธ ์ •๋ ฌ์„ ์กฐ์šฉํžˆ ์˜ค์—ผ์‹œํ‚ค๋Š”๋ฐ, ์ด Interspeech 2021 ์ž‘์—…์€ ๊ธฐ๋งŒ์ ์œผ๋กœ ๋‹จ์ˆœํ•œ ์งˆ๋ฌธ์„ ๋˜์ง‘๋‹ˆ๋‹ค: ์šฐ๋ฆฌ๊ฐ€ ํƒ์ง€๋œ ์˜ค๋ฐœ์Œ์„ ๋‹จ์ˆœํžˆ ์‚ฌ์ „์— ์ถ”๊ฐ€ํ•˜๋ฉด

11์›” 3, 2022ยท 1 min read
One-Edit-Distance FSA/Network-based (OEDN) in Mispronunciation Detection and Accented ASR
Tutorials

One-Edit-Distance FSA/Network-based (OEDN)๋ฅผ ์ด์šฉํ•œ ์˜ค๋ฐœ์Œ ํƒ์ง€ ๋ฐ ์‚ฌํˆฌ๋ฆฌ ASR

๋น„์›์–ด๋ฏผ ์Œ์„ฑ ๋ชจ๋ธ๋ง์€ ๋‹ญ๊ณผ ๊ณ„๋ž€ ๋ฌธ์ œ๋ฅผ ๊ฐ€์ง€๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค: ๋‚˜์œ ์Œ์„ฑ ์ •๋ ฌ์€ ๋‚˜์œ ๋ชจ๋ธ์„ ๋งŒ๋“ค๊ณ , ๋‚˜์œ ๋ชจ๋ธ์€ ๋‚˜์œ ์ •๋ ฌ์„ ๋งŒ๋“ญ๋‹ˆ๋‹ค.

9์›” 24, 2022ยท 1 min read
[Olewave's Short Review] Xception: Deep Learning with Depthwise Separable Convolutions
Tutorials

[Olewave์˜ ๋‹จํŽธ ๋ฆฌ๋ทฐ] Xception: ๊นŠ์ด๋ณ„ ๋ถ„๋ฆฌํ˜• ์ปจ๋ณผ๋ฃจ์…˜์„ ์ด์šฉํ•œ ๋”ฅ๋Ÿฌ๋‹

Xception์˜ ํ•ต์‹ฌ ์•„์ด๋””์–ด๋งŒ ์›ํ•˜๊ณ  ์žฅํŽธ ๋ฆฌ๋ทฐ์˜ ๊นŠ์€ ๋‚ด์šฉ์€ ์›ํ•˜์ง€ ์•Š๋Š”๋‹ค๋ฉด, ์ด ๋‹จํŽธ ๋ฆฌ๋ทฐ๊ฐ€ ๊ฐ„๋‹จํ•œ ๋ฒ„์ „์ž…๋‹ˆ๋‹ค.

7์›” 9, 2022ยท 1 min read
[Short Review] Conformer: Convolution-augmented Transformer for Speech Recognition
Tutorials

[๋‹จ๋ฌธ ๋ฆฌ๋ทฐ] Conformer: ์Œ์„ฑ ์ธ์‹์„ ์œ„ํ•œ Convolution-augmented Transformer

Conformer๋Š” ๊ฑฐ์˜ ๋‹จ์ˆœํ•œ ์ž‘์—…์„ ํ†ตํ•ด ASR ์„ธ๊ณ„๋ฅผ ํœฉ์“ธ์—ˆ์Šต๋‹ˆ๋‹ค: ๊ฐ Transformer ๋ธ”๋ก์— convolution ๋ชจ๋“ˆ์„ ๋ถ™์—ฌ ๋ชจ๋ธ์ด ์ „์—ญ ์ปจํ…์ŠคํŠธ์™€ ๋กœ์ปฌ ์Œํ–ฅ ์„ธ๋ถ€ ์ •๋ณด๋ฅผ ํ•œ ๋ฒˆ์— ํฌ์ฐฉํ•  ์ˆ˜ ์žˆ๋„๋ก ํ–ˆ์Šต๋‹ˆ๋‹ค.

6์›” 11, 2022ยท 1 min read
ๅšๅฃซๅคงๅ”ไฝฟ็”จ่ฎก็ฎ—ๆœบไฝœๅผŠ้™็ปดๆ‰“ๅ‡ป2022้ซ˜่€ƒๆ•ฐๅญฆๅŽ‹่ฝดๅคง้ข˜ Ph.D. uses computer cheating to solve 2022 college entrance math exam
Tutorials

๋ฐ•์‚ฌ ์•„์ €์”จ๊ฐ€ ์ปดํ“จํ„ฐ๋กœ 2022 ๋Œ€์ž… ์ˆ˜ํ•™ ์‹œํ—˜์˜ ์ตœ์ข… ๋ฌธ์ œ๋ฅผ ํ’€๋‹ค

์—ฐ๊ตฌ์šฉ ์ปดํ“จํ„ฐ ๋Œ€์ˆ˜ํ•™ ๋„๊ตฌ๋ฅผ 2022 ์ค‘๊ตญ ๊ฐ€์˜ค์นด์˜ค ์ˆ˜ํ•™ ์‹œํ—˜์˜ ๊ฐ€์žฅ ์–ด๋ ค์šด ๋ฌธ์ œ์— ์‚ฌ์šฉํ•˜๋ฉด ์–ด๋–ค ์ผ์ด ์ผ์–ด๋‚ ๊นŒ์š”?

6์›” 8, 2022ยท 1 min read
[Short Review] Towards Zero-Label Language Learning
Tutorials

[์งง์€ ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning

์ˆ˜๊ฐœ์›”์„ ๋“ค์—ฌ ์ฃผ์„์„ ์ง€์ •ํ•œ ๋ ˆ์ด๋ธ”๋œ ๋ฐ์ดํ„ฐ๊ฐ€ ์ •๋ง๋กœ ํ•„์š”ํ•˜์ง€ ์•Š๋‹ค๋ฉด ์–ด๋–จ๊นŒ์š”?

5์›” 7, 2022ยท 1 min read
[Long Review] Deduplicating Training Data Makes Language Models Better
Tutorials

[Long Review] ํ›ˆ๋ จ ๋ฐ์ดํ„ฐ ์ค‘๋ณต ์ œ๊ฑฐ๊ฐ€ ์–ธ์–ด ๋ชจ๋ธ์„ ๋” ์ข‹๊ฒŒ ๋งŒ๋“ ๋‹ค

์ค‘๋ณต ์ œ๊ฑฐ๋Š” ์ง€๋ฃจํ•ด ๋ณด์ด์ง€๋งŒ, C4 ๋‚ด์— 61๊ฐœ ๋‹จ์–ด๋กœ ๋œ ๋ฌธ์žฅ์ด 60,000๋ฒˆ ์ด์ƒ ๋‚˜ํƒ€๋‚˜๊ณ , ์ด๋Ÿฐ ๋ง๋ญ‰์น˜๋กœ ํ›ˆ๋ จ๋œ ์–ธ์–ด ๋ชจ๋ธ์ด ํ›ˆ๋ จ ์„ธํŠธ ํ…์ŠคํŠธ๋ฅผ ๋ถˆ์•ˆํ•˜๊ฒŒ re

4์›” 16, 2022ยท 1 min read
Triplets-like Russian Figure Skaters: Can Kullback-Leibler Divergence be Used Tell Their Difference?
Tutorials

์„ธ์Œ๋‘ฅ์ด์ฒ˜๋Ÿผ ๋‹ฎ์€ ๋Ÿฌ์‹œ์•„ ํ”ผ๊ฒจ ์Šค์ผ€์ดํ„ฐ๋“ค: Kullback-Leibler ๋ฐœ์‚ฐ์ด ๊ทธ๋“ค์˜ ์ฐจ์ด๋ฅผ ๊ตฌ๋ณ„ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๊นŒ?

์Šคํ”ผ์ปค ์ ์‘์€ ์‹œํ€€์Šค-ํˆฌ-์‹œํ€€์Šค ๋ชจ๋ธ์„ ์ธ์ฝ”๋”์˜ ์–ด๋ ต๊ฒŒ ํš๋“ํ•œ ์Œํ–ฅ ํ‘œํ˜„์„ ์†์ƒ์‹œํ‚ค์ง€ ์•Š๊ณ  ์ ์‘์‹œํ‚ค๋ ค๊ณ  ์‹ค์ œ๋กœ ์‹œ๋„ํ•  ๋•Œ๊นŒ์ง€ ํ•ด๊ฒฐ๋œ ๊ฒƒ์ฒ˜๋Ÿผ ๋“ค๋ฆฌ๋Š” ASR ๋ฌธ์ œ ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค.

2์›” 19, 2022ยท 1 min read
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units
Tutorials

HuBERT: ์ˆจ๊ฒจ์ง„ ๋‹จ์œ„์˜ ๋งˆ์Šคํ‚น ์˜ˆ์ธก์„ ํ†ตํ•œ ์ž์ฒด ์ง€๋„ ์Œ์„ฑ ํ‘œํ˜„ ํ•™์Šต

wav2vec 2.0์ด ๋Œ€์กฐ์  ์ž์ฒด ์ง€๋„๋กœ ๊ฒŒ์ž„์„ ๋ฐ”๊ฟจ์ง€๋งŒ, HuBERT๋Š” ๋” ๋‚ ์นด๋กœ์šด ์งˆ๋ฌธ์„ ์ œ์‹œํ–ˆ์Šต๋‹ˆ๋‹ค: ๋Œ€์กฐ์  ํŠธ๋ฆญ์„ ์™„์ „ํžˆ ๊ฑด๋„ˆ๋›ฐ๊ณ  ์Œ์„ฑ์—์„œ BERT ์Šคํƒ€์ผ์˜ ๋งˆ์Šคํ‚น ์˜ˆ์ธก์„ ์ˆ˜ํ–‰ํ•˜๋ฉด ์–ด๋–จ๊นŒ์š”?

12์›” 14, 2021ยท 1 min read
W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self Supervise
Tutorials

W2v-BERT: ๋Œ€์กฐ ํ•™์Šต๊ณผ ๋งˆ์Šคํ‚น๋œ ์–ธ์–ด ๋ชจ๋ธ๋ง์„ ๊ฒฐํ•ฉํ•œ ์ž์ฒด ์ง€๋„

์Œ์„ฑ ์‚ฌ์ „ ํ•™์Šต์„ ์œ„ํ•ด ๋Œ€์กฐ ํ•™์Šต๊ณผ ๋งˆ์Šคํ‚น๋œ ์–ธ์–ด ๋ชจ๋ธ๋ง ์ค‘์— ์„ ํƒํ•ด์•ผ ํ•  ๋•Œ ๋‘˜์„ ๊ฐ™์€ ๋„คํŠธ์›Œํฌ์— ์—ฐ๊ฒฐํ•  ์ˆ˜ ์žˆ๋‹ค๋ฉด ์™œ ์„ ํƒํ•ด์•ผ ํ• ๊นŒ์š”?

12์›” 12, 2021ยท 1 min read
Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition
Tutorials

์Œ์„ฑ ๊ฐ์ • ์ธ์‹ ๊ฐœ์„ ์„ ์œ„ํ•œ Wav2vec 2.0 ๋ฏธ์„ธ ์กฐ์ • ํƒ์ƒ‰

์Œ์„ฑ ๊ฐ์ • ์ธ์‹์€ ์˜ค๋žซ๋™์•ˆ ์ž‘์€ ๋ ˆ์ด๋ธ”๋œ ๋ฐ์ดํ„ฐ์…‹๊ณผ ์†์œผ๋กœ ๋งŒ๋“  ์Œํ–ฅ ํŠน์„ฑ์— ๊ฐ‡ํ˜€ ์žˆ์—ˆ์Šต๋‹ˆ๋‹ค.

12์›” 4, 2021ยท 1 min read
Joint Unsupervised and Supervised Training for Multilingual ASR
Tutorials

๋‹ค๊ตญ์–ด ASR์„ ์œ„ํ•œ ๊ณต๋™ ๋น„์ง€๋„ํ•™์Šต ๋ฐ ์ง€๋„ํ•™์Šต ํ›ˆ๋ จ

์‚ฌ์ „ ํ›ˆ๋ จ ํ›„ ๋ฏธ์„ธ ์กฐ์ •์ด ๋‹ค๊ตญ์–ด ASR์˜ ๊ธฐ๋ณธ ๋ ˆ์‹œํ”ผ๊ฐ€ ๋˜์—ˆ์ง€๋งŒ, ๋งŽ์€ ์ž ์žฌ๋ ฅ์„ ๋‚จ๊ธฐ๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค: ๋‘ ๋‹จ๊ณ„๊ฐ€ ์†์‹ค์„ ๊ณต์œ ํ•˜์ง€ ์•Š์œผ๋ฉฐ, ์ง€๋„ ๋‹จ๊ณ„๊ฐ€ ์œ ์šฉํ•œ ์ž์ฒด ์ง€๋„ ๊ตฌ์กฐ๋ฅผ ์กฐ์šฉํžˆ ์ œ๊ฑฐํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค

12์›” 4, 2021ยท 1 min read