Google의 SoundStream 심층 리뷰: 엔드-투-엔드 신경 오디오 코덱
신경 코덱은 조용히 현대 생성 오디오의 기초 계층이 되었고, SoundStream은 시작을 신호한 논문 중 하나입니다.
신경 코덱은 조용히 현대 생성 오디오의 기초 계층이 되었고, SoundStream은 시작을 신호한 논문 중 하나입니다. Google의 엔드-투-엔드 설계는 완전히 컨볼루셔널 인코더/디코더와 잔차 벡터 양자화기를 쌍으로 만들고, 모두 TTS 및 음성 향상 분야에서 차용된 적대 손실 및 재구성 손실로 공동으로 훈련됩니다. 제목 결과는 인상적입니다: 3 kbps에서 SoundStream은 12 kbps의 Opus를 능가하고, 음성, 음악, 및 일반 사운드에 걸쳐 24 kHz 오디오에서 9.6 kbps의 EVS에 근접합니다.
압축 수치를 넘어, 설계 선택지는 음성 기술을 배포하는 모든 사람에게 중요합니다. 양자화기 계층 전체의 구조화된 드롭아웃은 단일 모델이 재훈련 없이 3-18 kbps에 걸쳐 작동하도록 하고, 아키텍처는 스트림 가능한 추론을 통해 스마트폰 CPU에서 실시간으로 실행됩니다. 논문은 또한 배경 잡음 억제를 코덱에 직접 인코더 또는 디코더 측에서 추가 지연 없이 통합합니다. 신경 TTS 토큰, 저대역폭 통화, 또는 온디바이스 오디오 파이프라인에서 작업 중이라면, 이 튜토리얼은 나중에 AudioLM 및 그 후대 모델들을 구동한 아이디어에 대한 견고한 기초 지식이 될 것입니다. 아키텍처 분석과 주관적 평가 결과를 보려면 재생을 누르세요.
