음성 생성 AI: Meta AI의 VoiceBox(또한 Flow Matching 및 Neural ODE)
수년 동안 음성 생성은 규모와 일반성 모두에서 텍스트 및 이미지 생성보다 뒤처졌습니다. 모든 작업에는 고유한 맞춤형 모델이 있었습니다.
수년 동안 음성 생성은 규모와 일반성 모두에서 텍스트 및 이미지 생성보다 뒤처졌습니다. 모든 작업에는 고유한 맞춤형 모델이 있었습니다. Meta AI의 Voicebox는 이러한 패턴을 깨뜨렸습니다. 이는 한 가지 작업을 잘 수행하기 위해 50,000시간 이상의 필터링되지 않은 음성에 대해 훈련된 비자동회귀 흐름 일치 모델입니다. 즉, 주변 컨텍스트와 텍스트가 제공된 오디오 채우기입니다. 이 단일 목표는 동일한 체크포인트에서 제로 샷 TTS, 언어 간 합성, 노이즈 제거, 콘텐츠 편집 및 스타일 전송을 모두 잠금 해제합니다.
이 리뷰에서는 흐름 일치(및 그 아래에 있는 신경 ODE 기계)가 음성에 적합한 이유(지속적이고 비자기회귀적이며 비슷한 품질의 확산보다 훨씬 빠른 이유)를 설명합니다. 또한 헤드라인 숫자를 맥락에 맞게 표시합니다. Voicebox는 명료도(1.9% 대 5.9% WER)와 화자 유사성 모두에서 최대 20배 더 빠르게 실행되면서 VALL-E를 능가합니다. 음성 기반 모델이 VALL-E 및 Whisper 이후 어디로 향하는지 추적 중이거나 단지 유행어를 읽는 대신 흐름 일치가 수행하는 작업을 실제로 이해하려는 경우 심층 분석을 들어볼 가치가 있습니다.
