Blog

Videos
Review Microsoft's VALL-E 2 (Achieving Human Parity in Zero-shot TTS)
Tutorials

Microsoft์˜ VALL-E 2 ๊ฒ€ํ† (์ œ๋กœ์ƒท TTS์—์„œ ์ธ๊ฐ„ ํŒจ๋ฆฌํ‹ฐ ๋‹ฌ์„ฑ)

์ œ๋กœ ์ƒท TTS๋Š” ๋งŽ์€ ์‚ฌ๋žŒ๋“ค์ด ์•„์ง ๋ช‡ ๋…„์€ ๋ฉ€๋‹ค๊ณ  ์ƒ๊ฐํ–ˆ๋˜ ์„ ์„ ๋„˜์—ˆ์Šต๋‹ˆ๋‹ค. Microsoft์˜ VALL-E 2๋Š” ๊ฒฌ๊ณ ์„ฑ, ์ž์—ฐ์„ฑ ๋ฐ ์–ธ์–ด ์ „๋ฐ˜์— ๊ฑธ์ณ LibriSpeech ๋ฐ VCTK ๋ชจ๋‘์—์„œ ์ธ๊ฐ„ ํŒจ๋ฆฌํ‹ฐ๋ฅผ ๋‹ฌ์„ฑํ•œ ์ตœ์ดˆ์˜ ์‹ ๊ฒฝ ์ฝ”๋ฑ ์–ธ์–ด ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

5์›” 7, 2025ยท 1 min read
Review DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation ~ Seed-TTS
Tutorials

๊ฒ€ํ†  DiTAR: ํ™•์‚ฐ Transformer ์Œ์„ฑ ์ƒ์„ฑ์„ ์œ„ํ•œ ์ž๋™ ํšŒ๊ท€ ๋ชจ๋ธ๋ง ~ Seed-TTS

Seed-TTS ํŒ€์ด DiTAR๊ณผ ํ•จ๊ป˜ ๋Œ์•„์™”๊ณ , ์ด๋Š” ํ˜„๋Œ€ ์Œ์„ฑ ์ƒ์„ฑ์˜ ๋” ๊นŒ๋‹ค๋กœ์šด ํŠธ๋ ˆ์ด๋“œ์˜คํ”„ ์ค‘ ํ•˜๋‚˜์— ๋Œ€ํ•œ ๊น”๋”ํ•œ ๋‹ต์ž…๋‹ˆ๋‹ค: continuous speech representations์˜ ์œ ์—ฐ์„ฑ์„ ์œ ์ง€ํ•˜๋ฉด์„œ comp

4์›” 19, 2025ยท 1 min read
Review ByteDance/Tiktok's Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
Tutorials

ByteDance/Tiktok์˜ Seed-TTSโ€Œ: ๊ณ ํ’ˆ์งˆ ๋‹ค๋ชฉ์  ์Œ์„ฑ ์ƒ์„ฑ ๋ชจ๋ธ ์ œํ’ˆ๊ตฐ ๊ฒ€ํ† 

ByteDance์˜ Seed-TTS๋Š” TTS๊ฐ€ ์š”์†Œ์—์„œ ์ง„์ •ํ•œ ๊ธฐ์ดˆ ๋ชจ๋ธ๋กœ ์กธ์—…ํ•˜๊ณ  ์žˆ๋‹ค๋Š” ๊ฐ€์žฅ ๊ฐ•๋ ฅํ•œ ์‹ ํ˜ธ ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค.

4์›” 11, 2025ยท 1 min read
From OpenAI Whisper to Your In-House ASR Service: Recognizing Name Entities & Domain-Specific Terms
Tutorials

OpenAI Whisper์—์„œ ์‚ฌ๋‚ด ASR ์„œ๋น„์Šค๊นŒ์ง€: ์ด๋ฆ„ ์—”ํ„ฐํ‹ฐ ๋ฐ ๋„๋ฉ”์ธ๋ณ„ ์šฉ์–ด ์ธ์‹

Whisper๋Š” ๊ธฐ๋ณธ ์ƒํƒœ๋กœ๋„ ์ธ์ƒ์ ์ด์ง€๋งŒ, ์‹ค์ œ๋กœ ํ”„๋กœ๋•์…˜์— ๋ฐฐํฌํ•ด๋ณธ ๋ˆ„๊ตฌ๋‚˜ ์ด ๊ณ ํ†ต์„ ์•Œ ๊ฒƒ์ž…๋‹ˆ๋‹ค: ๊ณ ์œ ๋ช…์‚ฌ, ์ œํ’ˆ ์ด๋ฆ„, ์˜๋ฃŒ ์šฉ์–ด, ๋ฒ•๋ฅ  ์šฉ์–ด, ๊ทธ๋ฆฌ๊ณ  ๋„๋ฉ”์ธ ์–ดํœ˜์˜ ๊ธด ๊ผฌ๋ฆฌ ์ „์ฒด๋ฅผ ์ œ๋Œ€๋กœ ์ธ์‹ํ•˜์ง€ ๋ชปํ•ฉ๋‹ˆ๋‹ค

12์›” 20, 2024ยท 1 min read
Meta's Movie Gen vs. OpenAI's Sora: a Detailed Review
Tutorials

Meta์˜ Movie Gen ๋Œ€ OpenAI์˜ Sora: ์ž์„ธํ•œ ๊ฒ€ํ† 

Meta๋Š” ๋งˆ์นจ๋‚ด Sora์— ๋งž์„œ๋Š” ์†์„ ๋“œ๋Ÿฌ๋ƒˆ์œผ๋ฉฐ, Movie Gen์€ ๋‹จ์ˆœํ•œ ๋น„๋””์˜ค ์ƒ์„ฑ๊ธฐ ์ด์ƒ์ž…๋‹ˆ๋‹ค โ€” ๋™๊ธฐํ™”๋œ ์˜ค๋””์˜ค์™€ ํ•จ๊ป˜ ์—ฌ๋Ÿฌ ์ข…ํšก๋น„์—์„œ 1080p HD ๋น„๋””์˜ค๋ฅผ ์ƒ์„ฑํ•˜๋Š” ๊ธฐ์ดˆ ๋ชจ๋ธ๋“ค์˜ ๋ชจ์Œ์ด๋ฉฐ, ์ •๋ฐ€ํ•œ

10์›” 25, 2024ยท 1 min read
Google Researcher's In-Depth Analysis on End-to-End Speech Recognition, Part 1: Overview & Modeling
Tutorials

Google ์—ฐ๊ตฌ์›์˜ ์—”๋“œํˆฌ์—”๋“œ ์Œ์„ฑ ์ธ์‹ ์‹ฌ์ธต ๋ถ„์„, 1๋ถ€: ๊ฐœ์š” ๋ฐ ๋ชจ๋ธ๋ง

๊นŠ์€ ํ•™์Šต์˜ 10๋…„์ด ASR ๋‹จ์–ด ์˜ค๋ฅ˜์œจ์„ 50% ์ด์ƒ ์ƒ๋Œ€์ ์œผ๋กœ ๋‚ฎ์ถ”์—ˆ๊ณ , ๋™์‹œ์— ๊ณ ์ „์ ์ธ HMM ํŒŒ์ดํ”„๋ผ์ธ์„ ์œ ๋ฌผ์ฒ˜๋Ÿผ ๋ณด์ด๊ฒŒ ๋งŒ๋“ค์—ˆ์Šต๋‹ˆ๋‹ค.

6์›” 7, 2024ยท 1 min read
Deduct OpenAI GPT-4o's Neural Network Architecture
Tutorials

OpenAI GPT-4o์˜ ์‹ ๊ฒฝ๋ง ์•„ํ‚คํ…์ฒ˜ ์ถ”๋ก 

OpenAI๋Š” GPT-4o์— ๋Œ€ํ•œ ๋…ผ๋ฌธ์„ ๋ฐœํ‘œํ•˜์ง€ ์•Š์•˜์œผ๋ฏ€๋กœ, ์ด ๋น„๋””์˜ค๋Š” ๊ทธ ๋‹ค์Œ ์ตœ์„ ์˜ ๋ฐฉ๋ฒ•์„ ์‹œ๋„ํ•ฉ๋‹ˆ๋‹ค: OpenAI๊ฐ€ ์‹ค์ œ๋กœ ์‹œ์—ฐํ•œ ๊ธฐ๋Šฅ์„ ๊ธฐ๋ฐ˜์œผ๋กœ ์‹ ๊ฒฝ๋ง ์•„ํ‚คํ…์ฒ˜๊ฐ€ ๊ฑฐ์˜ ํ™•์‹คํ•˜๊ฒŒ ์–ด๋–ค ๋ชจ์Šต์ผ์ง€๋ฅผ ์—ญ์—”์ง€๋‹ˆ์–ด๋งํ•ฉ๋‹ˆ๋‹ค

5์›” 17, 2024ยท 1 min read
Google's Universal Speech Model for 100+ languages beats OpenAI's Whisper Model
Tutorials

100๊ฐœ ์ด์ƒ์˜ ์–ธ์–ด์— ๋Œ€ํ•œ Google์˜ ๋ฒ”์šฉ ์Œ์„ฑ ๋ชจ๋ธ์€ โ€Œโ€ŒESPnetโ€Œ์˜ โ€Œโ€ŒLlama 3โ€Œ ๋ชจ๋ธ์„ ๋Šฅ๊ฐ€ํ•ฉ๋‹ˆ๋‹ค.

Google์˜ Universal Speech Model์€ ์กฐ์šฉํžˆ ๋†€๋ผ์šด ๊ฒƒ์„ ํ–ˆ์Šต๋‹ˆ๋‹ค: ๋ ˆ์ด๋ธ”์ด ์ง€์ •๋œ ํ•™์Šต ๋ฐ์ดํ„ฐ์˜ ์•ฝ 1/7์„ ์‚ฌ์šฉํ•˜๋ฉด์„œ 100๊ฐœ ์ด์ƒ์˜ ์–ธ์–ด์—์„œ OpenAI์˜ Whisper์„ ASR์—์„œ ๋งž์ถ”๊ฑฐ๋‚˜ ๋Šฅ๊ฐ€ํ–ˆ์Šต๋‹ˆ๋‹ค.

5์›” 6, 2024ยท 1 min read
Long Review: Apple's MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
Tutorials

์žฅ๊ธฐ ๊ฒ€ํ† : Apple์˜ MM1: ๋‹ค์ค‘ ๋ชจ๋“œ LLM ์‚ฌ์ „ ๊ต์œก์„ ํ†ตํ•œ ๋ฐฉ๋ฒ•, ๋ถ„์„ ๋ฐ ํ†ต์ฐฐ๋ ฅ

Apple์€ ๋งŽ์ด ๋ฐœํ–‰ํ•˜์ง€ ์•Š์ง€๋งŒ, MM1 ๋…ผ๋ฌธ์ด ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ LLM ์‚ฌ์ „ํ›ˆ๋ จ์— ๋Œ€ํ•œ ์ „์ฒด ์ ˆ์ œ ์—ฐ๊ตฌ์™€ ํ•จ๊ป˜ ๋ฐœํ‘œ๋˜์—ˆ์„ ๋•Œ, ์ด๋Š” MLLMs์„ ๊ตฌ์ถ•ํ•˜๋Š” ๋ชจ๋“  ์‚ฌ๋žŒ๋“ค์„ ์œ„ํ•œ ์˜ฌํ•ด์˜ ๋” ์œ ์šฉํ•œ ๋ฐ์ดํ„ฐ ๋ฆด๋ฆฌ์Šค ์ค‘ ํ•˜๋‚˜์˜€์Šต๋‹ˆ๋‹ค.

3์›” 31, 2024ยท 1 min read
A Quick Review of Apple's SOTA Multimodal LLM: MM1
Tutorials

Apple์˜ SOTA ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ LLMโ€Œ์— ๋Œ€ํ•œ ๊ฐ„๋žตํ•œ ๊ฒ€ํ† : MM1

MM1์— ๋Œ€ํ•œ ์™„์ „ํ•œ ๋ถ„์„์„ ๋ณผ ์‹œ๊ฐ„์ด ์—†๋‹ค๋ฉด, ์ด ๋น ๋ฅธ ๋ฆฌ๋ทฐ๋Š” ๋ช‡ ๋ถ„ ๋งŒ์— ํ•ต์‹ฌ์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค: Apple์ด ๋ฌด์—‡์„ ๊ตฌ์ถ•ํ–ˆ๋Š”์ง€, ์•„ํ‚คํ…์ฒ˜์™€ ๋ฐ์ดํ„ฐ์— ๋Œ€ํ•œ ์ œ๊ฑฐ ์—ฐ๊ตฌ์—์„œ ๋ฌด์—‡์„ ๋ฐฐ์› ๋Š”์ง€, ๊ทธ๋ฆฌ๊ณ  ์–ด๋–ค ์„ค๊ณ„ ๊ฒฐ์ •์ด

3์›” 24, 2024ยท 1 min read
The Secret That Made Claude 3 Trump GPT-4
Tutorials

OpenAI 3 ํŠธ๋Ÿผํ”„๋ฅผ ๋งŒ๋“  ๋น„๋ฐ€ EMNLP

Claude 3 Opus๊ฐ€ MMLU, GPQA, GSM8K, ๊ทธ๋ฆฌ๊ณ  ๋Œ€๋ถ€๋ถ„์˜ ์ตœ์ฒจ๋‹จ ํ‰๊ฐ€ ๋ฒค์น˜๋งˆํฌ์—์„œ GPT-4๋ฅผ ๋Šฅ๊ฐ€ํ–ˆ์„ ๋•Œ, ํฅ๋ฏธ๋กœ์šด ์งˆ๋ฌธ์€ Anthropic์ด ๋‹จ์ˆœํžˆ ๋” ํฐ ๊ทœ๋ชจ๋กœ ํ•™์Šตํ–ˆ๋Š”์ง€ ์—ฌ๋ถ€๊ฐ€ ์•„๋‹ˆ๋ผ โ€” ํ›ˆ๋ จ์˜ ๋น„๊ฒฐ์ด ๋ฌด์—‡์ด์—ˆ๋Š”์ง€์— ๊ด€ํ•œ ๊ฒƒ์ž…๋‹ˆ๋‹ค

3์›” 8, 2024ยท 1 min read
Generative AI Models Related to Sora: Normalizing Flows
Tutorials

Sora ๊ด€๋ จ ์ƒ์„ฑ์  AI ๋ชจ๋ธ: ํ๋ฆ„ ์ •๊ทœํ™”

๋ชจ๋‘๊ฐ€ diffusion์— ๋Œ€ํ•ด ์–˜๊ธฐํ•˜๊ณ  ์žˆ์ง€๋งŒ, Sora์™€ ํ˜„๋Œ€ ์ƒ์„ฑ ๋น„๋””์˜ค๋ฅผ ๋‚ณ์€ ๊ฐ€์กฑ ๊ณ„ํ†ต์„ ์‹ค์ œ๋กœ ์ดํ•ดํ•˜๊ณ  ์‹ถ๋‹ค๋ฉด, ์ •๊ทœํ™” ํ๋ฆ„ โ€” ์ƒ์„ฑ ๋ชจ๋ธ์˜ ํ•œ ์ข…๋ฅ˜์ธ

3์›” 1, 2024ยท 1 min read
Variational Autoencoder (VAE) and Reparameterization Trick - Revisiting the Classic Generative Model
Tutorials

VAE(Variational Autoencoder) ๋ฐ ์žฌ๋งค๊ฐœ๋ณ€์ˆ˜ํ™” ํŠธ๋ฆญ - ํด๋ž˜์‹ ์ƒ์„ฑ ๋ชจ๋ธ ์žฌ๊ฒ€ํ† 

ํ™•์‚ฐ ์ด์ „์—, ์ •๊ทœํ™” ํ๋ฆ„ ์ด์ „์—, ์ž ์žฌ ํ™•์‚ฐ ๋ชจ๋ธ์ด ๋ชจ๋“  ์ฃผ์š” ์ƒ์„ฑ ์Šคํƒ์— VAE ์ธ์ฝ”๋”๋ฅผ ์กฐ์šฉํžˆ ๊ตฌ์ถ•ํ•˜๊ธฐ ์ด์ „์— โ€” Kingma์™€ Welling์˜ 2013๋…„ ๋…ผ๋ฌธ์ด ๋ณ€๋™ํ˜• ์ž๋™์ธ์ฝ”๋”๋ฅผ ์†Œ๊ฐœํ–ˆ๋‹ค

2์›” 24, 2024ยท 1 min read
A Review of Microsoft+OpenAI, Google, Meta, and Nvidia's Open Source Large Speech Models for ASR
Tutorials

Microsoft+OpenAI, Google, Meta, Nvidia์˜ SDK์šฉ ์˜คํ”ˆ ์†Œ์Šค ๋Œ€ํ˜• ์Œ์„ฑ ๋ชจ๋ธ ๊ฒ€ํ† 

๋ชจ๋“  ์ฃผ์š” AI ์—ฐ๊ตฌ์†Œ๊ฐ€ ์ด์ œ ASR์„ ์œ„ํ•œ ์˜คํ”ˆ์†Œ์Šค ๋Œ€๊ทœ๋ชจ ์Œ์„ฑ ๋ชจ๋ธ์„ ๋ฐฐํฌํ–ˆ์œผ๋ฉฐ, ํ”„๋กœ๋•์…˜์„ ์œ„ํ•ด ์˜ฌ๋ฐ”๋ฅธ ๋ชจ๋ธ์„ ์„ ํƒํ•˜๋Š” ๊ฒƒ์ด ์‹ค์ œ ๊ฒฐ์ •์ด ๋˜์—ˆ๋‹ค.

2์›” 9, 2024ยท 1 min read
[Detailed Paper Reading] Zipformer: A faster and better encoder for automatic speech recognition
Tutorials

[์ƒ์„ธ ๋…ผ๋ฌธ ์ฝ๊ธฐ] Zipformer: ์ž๋™ ์Œ์„ฑ ์ธ์‹์„ ์œ„ํ•œ ๋” ๋น ๋ฅด๊ณ  ํ–ฅ์ƒ๋œ ์ธ์ฝ”๋”

Conformer๋Š” ์ˆ˜๋…„ ๋™์•ˆ ๊ธฐ๋ณธ ASR ์ธ์ฝ”๋”์˜€์œผ๋‚˜, k2/icefall ํŒ€์˜ Zipformer๊ฐ€ LibriSpeech, Aishell-1, WenetSpeech์—์„œ WER ์™•๊ด€์„ ์กฐ์šฉํžˆ ์ฐจ์ง€ํ–ˆ์œผ๋ฉด์„œ๋„ ๋” ๋น ๋ฅด๊ณ  ๊ฐ€๋ณ๋‹ค.

2์›” 6, 2024ยท 1 min read
Tycho:a tookit for building high-ROI in-house speech-related services (ASR/TTS/Translation):Overview
Tutorials

Tycho: ROI๊ฐ€ ๋†’์€ ์‚ฌ๋‚ด ์Œ์„ฑ ๊ด€๋ จ ์„œ๋น„์Šค ๊ตฌ์ถ•์„ ์œ„ํ•œ ์š”์•ฝ(ASR/TTS/๋ฒˆ์—ญ):๊ฐœ์š”

์ธํ•˜์šฐ์Šค ASR, TTS ๋˜๋Š” ์Œ์„ฑ ๋ฒˆ์—ญ ์„œ๋น„์Šค๋ฅผ ์›ํ•˜๋Š” ๋Œ€๋ถ€๋ถ„์˜ ํŒ€์€ ๋™์ผํ•œ ๋ณต์žกํ•œ ์„ ํƒ์— ์ง๋ฉดํ•ฉ๋‹ˆ๋‹ค: ESPnet, NeMo, k2, HuggingFace์˜ ๋‹จํŽธ๋“ค์„ ํ•จ๊ป˜ ์—ฐ๊ฒฐํ•˜๊ฑฐ๋‚˜, ๋ชจ๋“  ๊ฒƒ์„ ํด๋ผ์šฐ๋“œ API์— ๋งก๊ธฐ๊ณ  ๋ถ„๋‹น ๋น„์šฉ์„ ์ง€๋ถˆํ•ฉ๋‹ˆ๋‹ค fore

1์›” 26, 2024ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Postprocessing and Language Modeling
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์ฒด ์‚ฌ๋‚ด โ€Œโ€ŒSDKโ€Œ ์„œ๋น„์Šค๋กœ: ํ›„์ฒ˜๋ฆฌ ๋ฐ ์–ธ์–ด ๋ชจ๋ธ๋ง

์›๋ณธ Whisper ์ถœ๋ ฅ์€ ์ฒ˜์Œ๋ถ€ํ„ฐ ์ธ์ƒ์ ์ด์ง€๋งŒ, ์‹ค์ œ ์‚ฌ์šฉ์ž์—๊ฒŒ ๋ฐฐํฌํ•œ ์‚ฌ๋žŒ์ด๋ผ๋ฉด ๋ˆ„๊ตฌ๋‚˜ ๋ฐ๋ชจ ํŠธ๋žœ์Šคํฌ๋ฆฝํŠธ์™€ ๋‹ค์šด์ŠคํŠธ๋ฆผ ์‹œ์Šคํ…œ์ด ์‹ค์ œ๋กœ ์†Œ๋น„ํ•  ์ˆ˜ ์žˆ๋Š” ๊ฒƒ ์‚ฌ์ด์˜ ๊ฒฉ์ฐจ๋ฅผ ์•Œ๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

1์›” 12, 2024ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Long Audio and Streaming (Part 3)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์ฒด ์‚ฌ๋‚ด ASR ์„œ๋น„์Šค๊นŒ์ง€: ๊ธด ์˜ค๋””์˜ค ๋ฐ ์ŠคํŠธ๋ฆฌ๋ฐ(3๋ถ€)

Whisper๋Š” 30์ดˆ ์ฒญํฌ์—์„œ ํ•™์Šต๋˜์—ˆ์œผ๋ฉฐ, 2์‹œ๊ฐ„ ํŒŸ์บ์ŠคํŠธ๋ฅผ ์ œ๊ณตํ•˜๊ฑฐ๋‚˜ ๋ผ์ด๋ธŒ ์บก์…”๋‹ ํŒŒ์ดํ”„๋ผ์ธ์— ์—ฐ๊ฒฐํ•˜๋ ค๊ณ  ํ•˜๋Š” ์ˆœ๊ฐ„ ์ด๊ฒƒ์ด ๋“œ๋Ÿฌ๋‚ฉ๋‹ˆ๋‹ค.

12์›” 15, 2023ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: ROI (Return-on-Investment) (Part 2)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์ฒด ์‚ฌ๋‚ด โ€Œโ€ŒSDKโ€Œ ์„œ๋น„์Šค๋กœ: ROI(ํˆฌ์ž ์ˆ˜์ต๋ฅ )(2๋ถ€)

ASR์˜ ๋นŒ๋“œ ๋Œ€ ๊ตฌ๋งค ์งˆ๋ฌธ์€ ๋ณดํ†ต ์ •ํ™•๋„ ๋Œ€ ํŽธ์˜์„ฑ์œผ๋กœ ํ”„๋ ˆ์ž„๋˜์ง€๋งŒ, ์‹ค์ œ ๊ฒฐ์ • ์š”์†Œ๋Š” ์ œํ’ˆ ์ˆ˜๋ช… ๊ธฐ๊ฐ„์˜ ROI์ž…๋‹ˆ๋‹ค.

12์›” 2, 2023ยท 1 min read
From OpenAI's Whisper Model to Your Own In-House ASR Service: Overview (Part 1)
Tutorials

OpenAI์˜ Whisper ๋ชจ๋ธ์—์„œ ์ž์ฒด ์‚ฌ๋‚ด โ€Œโ€ŒSDKโ€Œ ์„œ๋น„์Šค๊นŒ์ง€: ๊ฐœ์š”(1๋ถ€)

OpenAI๋Š” Whisper๋ฅผ ์˜คํ”ˆ ์†Œ์Šค๋กœ ์ œ๊ณตํ•˜๋ฉด์„œ ์‚ฌ๋‚ด ASR ์„œ๋น„์Šค์˜ ๋ชจ์Šต์— ๋Œ€ํ•œ ๊ธฐ์ค€์„ ์กฐ์šฉํžˆ ์žฌ์„ค์ •ํ–ˆ์Šต๋‹ˆ๋‹ค.

11์›” 3, 2023ยท 1 min read
Why word timestamps generated by OpenAI Whisper are not accurate? How to make them accurate again?
Tutorials

OpenAI Whisper์— ์˜ํ•ด ์ƒ์„ฑ๋œ ๋‹จ์–ด ํƒ€์ž„์Šคํƒฌํ”„๊ฐ€ ์ •ํ™•ํ•˜์ง€ ์•Š์€ ์ด์œ ๋Š” ๋ฌด์—‡์ž…๋‹ˆ๊นŒ? ๋‹ค์‹œ ์ •ํ™•ํ•˜๊ฒŒ ๋งŒ๋“œ๋Š” ๋ฐฉ๋ฒ•์€ ๋ฌด์—‡์ž…๋‹ˆ๊นŒ?

Whisper์— ๋‹จ์–ด ํƒ€์ž„์Šคํƒฌํ”„๋ฅผ ์š”์ฒญํ•˜๋ฉด ์ˆซ์ž๋ฅผ ๋‹ค์‹œ ์–ป์„ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ํ•˜์ง€๋งŒ ๋…ธ๋ž˜๋ฐฉ, ์บก์…˜ ๋˜๋Š” ๋”๋น™์„ ์œ„ํ•œ ์‹ค์ œ ์˜ค๋””์˜ค์™€ ์ •๋ ฌํ•˜๋ ค๊ณ  ์‹œ๋„ํ•œ ์ ์ด ์žˆ๋‹ค๋ฉด ๊ทธ๊ฒƒ์ด ํ‘œ๋ฅ˜ํ•˜๊ณ  ์ž˜๋ชป๋œ ๊ฒฝ๊ณ„์— ๋งž์ถฐ์ง€๋ฉฐ ๊ฐ€๋” ๋ฐœ์ƒํ•œ๋‹ค๋Š” ๊ฒƒ์„ ์•Œ ๊ฒƒ์ž…๋‹ˆ๋‹ค.

10์›” 20, 2023ยท 1 min read
Speech Generative AI: VoiceBox by Meta AI (also Flow Matching and Neural ODE)
Tutorials

์Œ์„ฑ ์ƒ์„ฑ AI: Meta AI์˜ VoiceBox(๋˜ํ•œ Flow Matching ๋ฐ Neural ODE)

์ˆ˜๋…„ ๋™์•ˆ ์Œ์„ฑ ์ƒ์„ฑ์€ ๊ทœ๋ชจ์™€ ์ผ๋ฐ˜์„ฑ ๋ชจ๋‘์—์„œ ํ…์ŠคํŠธ ๋ฐ ์ด๋ฏธ์ง€ ์ƒ์„ฑ๋ณด๋‹ค ๋’ค์ฒ˜์กŒ์Šต๋‹ˆ๋‹ค. ๋ชจ๋“  ์ž‘์—…์—๋Š” ๊ณ ์œ ํ•œ ๋งž์ถคํ˜• ๋ชจ๋ธ์ด ์žˆ์—ˆ์Šต๋‹ˆ๋‹ค.

9์›” 14, 2023ยท 1 min read
I-JEPA: Yannn LeCun's First 'World Model' for Computer Vision
Tutorials

I-JEPA: Yannn LeCun์˜ ์ฒซ ๋ฒˆ์งธ ์ปดํ“จํ„ฐ ๋น„์ „ '์„ธ๊ณ„ ๋ชจ๋ธ'

Yann LeCun์€ ์ƒ์„ฑ์  ์‚ฌ์ „ ํ›ˆ๋ จ์ด ์„ธ์ƒ์„ ์ดํ•ดํ•˜๋Š” ๊ธฐ๊ณ„๋ฅผ ๋งŒ๋“œ๋Š” ๋ฐ ์ž˜๋ชป๋œ ์„ ํƒ์ด๋ผ๊ณ  ์ˆ˜๋…„ ๋™์•ˆ ์ฃผ์žฅํ•ด ์™”์Šต๋‹ˆ๋‹ค.

6์›” 17, 2023ยท 1 min read
LoRA: allow a high school student to train Large Language Model (GPT-3) with a gaming graphics card
Tutorials

LoRA: ๊ณ ๋“ฑํ•™์ƒ์ด ๊ฒŒ์ž„ ๊ทธ๋ž˜ํ”ฝ ์นด๋“œ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๋Œ€ํ˜• ์–ธ์–ด ๋ชจ๋ธ(GPT-3)์„ ํ›ˆ๋ จํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

175B ๋งค๊ฐœ๋ณ€์ˆ˜ GPT-3์˜ ์ „์ฒด ๋ฏธ์„ธ ์กฐ์ •์€ ๊ฑฐ์˜ ๋ชจ๋“  ์‚ฌ๋žŒ์—๊ฒŒ ์‹œ์ž‘์ด ์•„๋‹™๋‹ˆ๋‹ค. ์Šคํ† ๋ฆฌ์ง€๋งŒ์œผ๋กœ๋Š” ์ด๋ฅผ ๋ฐฐ์ œํ•˜๊ณ  GPU๋Š” ์‹ ๊ฒฝ ์“ฐ์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

6์›” 3, 2023ยท 1 min read
A Review of SpeechT5: Introducing Google's T5 into Speech (ASR, TTS, SID, ...) Tasks
Tutorials

SpeechT5 ๊ฒ€ํ† : ์Œ์„ฑ์— Google T5 ๋„์ž…(ASR, TTS, SID, ...)

T5๋Š” ๋‹จ์ผ ์ธ์ฝ”๋”-๋””์ฝ”๋” ์‚ฌ์ „ ํ•™์Šต ๋ ˆ์‹œํ”ผ์— ๋”ฐ๋ผ ํ…์ŠคํŠธ ๊ฐ„ ์ž‘์—…์„ ํ†ตํ•ฉํ–ˆ์œผ๋ฉฐ NLP์˜ ์ฃผ๋ ฅ ์ œํ’ˆ์ด ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

5์›” 20, 2023ยท 1 min read
A Review of Deepmind's WaveNet for TTS/Audio Synthesis (Does it look like GPT to you?)
Tutorials

TTS/์˜ค๋””์˜ค ํ•ฉ์„ฑ์„ ์œ„ํ•œ Deepmind์˜ WaveNet์— ๋Œ€ํ•œ ๋ฆฌ๋ทฐ(๋‹น์‹ ์—๊ฒŒ GPT๋กœ ๋ณด์ž…๋‹ˆ๊นŒ?)

Tacotron ์ด์ „, VALL-E ์ด์ „, ์‹ ๊ฒฝ ์ฝ”๋ฑ์ด ์˜ค๋””์˜ค๋ฅผ ํ† ํฐ์œผ๋กœ ์ „ํ™˜ํ•˜๊ธฐ ์ „, DeepMind์˜ WaveNet๋Š” ์‹ ๊ฒฝ๋ง์ด ์ƒ˜ํ”Œ๋ณ„๋กœ ์›์‹œ ์˜ค๋””์˜ค ํŒŒํ˜•์„ ์ƒ์„ฑํ•˜๊ณ  ๋ชจ๋“  ๋งค๊ฐœ๋ณ€์ˆ˜๋ฅผ ์ด๊ธธ ์ˆ˜ ์žˆ์Œ์„ ๋ณด์—ฌ์ฃผ๋Š” ๋…ผ๋ฌธ์ด์—ˆ์Šต๋‹ˆ๋‹ค.

5์›” 6, 2023ยท 1 min read
Review of HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis
Tutorials

Tacotron ๊ฒ€ํ† : ํšจ์œจ์ ์ด๊ณ  ์ถฉ์‹ค๋„๊ฐ€ ๋†’์€ ์Œ์„ฑ ํ•ฉ์„ฑ์„ ์œ„ํ•œ ์ƒ์„ฑ์  ์ ๋Œ€ ์‹ ๊ฒฝ๋ง

์˜ค๋žซ๋™์•ˆ ์‹ ๊ฒฝ ๋ณด์ฝ”๋”๋Š” ํ•œ ์ชฝ์„ ์„ ํƒํ•˜๋„๋ก ๊ฐ•์š”ํ–ˆ์Šต๋‹ˆ๋‹ค. WaveNet์™€ ๊ฐ™์€ ์ž๋™ ํšŒ๊ท€ ๋ชจ๋ธ์€ ๋ฉ‹์ง„ ์˜ค๋””์˜ค๋ฅผ ์ œ๊ณตํ–ˆ์ง€๋งŒ ๊ณ ํ†ต์Šค๋Ÿฌ์šธ ์ •๋„๋กœ ๋А๋ฆฐ ๋ฐ˜๋ฉด, GAN ๊ธฐ๋ฐ˜ ํŒŒํ˜• ๋ฐœ์ƒ๊ธฐ๋Š” ๋น ๋ฅด์ง€๋งŒ ํ’ˆ์งˆ์ด ๋ˆˆ์— ๋„๊ฒŒ ๋‚ฎ์•˜์Šต๋‹ˆ๋‹ค.

4์›” 22, 2023ยท 1 min read
In-depth Review of Google's SoundStream: An End-to-End Neural Audio Codec
Tutorials

Google์˜ SoundStreamโ€Œ์— ๋Œ€ํ•œ ์‹ฌ์ธต ๊ฒ€ํ† : ์—”๋“œํˆฌ์—”๋“œ ์‹ ๊ฒฝ ์˜ค๋””์˜ค ์ฝ”๋ฑ

์‹ ๊ฒฝ ์ฝ”๋ฑ์€ ์กฐ์šฉํžˆ ํ˜„๋Œ€ ์ƒ์„ฑ ์˜ค๋””์˜ค์˜ ๊ธฐ์ดˆ ๋ ˆ์ด์–ด๊ฐ€ ๋˜์—ˆ์œผ๋ฉฐ, SoundStream๋Š” ์ด๋ฅผ ์‹คํ˜„ํ•œ ๋…ผ๋ฌธ ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค.

4์›” 8, 2023ยท 1 min read
Disclosing OpenAI GPT-4's vision+text model, data, and cost to train (speculated)
Tutorials

OpenAI GPT-4์˜ ๋น„์ „+ํ…์ŠคํŠธ ๋ชจ๋ธ, ๋ฐ์ดํ„ฐ, ๊ต์œก ๋น„์šฉ ๊ณต๊ฐœ(์ถ”์ธก)

OpenAI๋Š” GPT-4์˜ ์•„ํ‚คํ…์ฒ˜, ๋งค๊ฐœ๋ณ€์ˆ˜ ์ˆ˜, ๊ต์œก ๋ฐ์ดํ„ฐ ๋˜๋Š” ์ปดํ“จํŒ… ์˜ˆ์‚ฐ ๊ณต๊ฐœ๋ฅผ ๊ฑฐ๋ถ€ํ•œ ๊ฒƒ์œผ๋กœ ์œ ๋ช…ํ•˜๋ฉฐ, ์ด๋กœ ์ธํ•ด ๊ธฐ์ˆ  ๋ณด๊ณ ์„œ๊ฐ€ ML ์ปค๋ฎค๋‹ˆํ‹ฐ๋ฅผ ์œ„ํ•œ ๋กœ๋ฅด์ƒคํ ํ…Œ์ŠคํŠธ๋กœ ์ „ํ™˜๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

4์›” 1, 2023ยท 1 min read