[Olewave의 리뷰] OpenAI의 Whisper ASR: 대규모 약한 지도를 통한 강건한 음성 인식
OpenAI가 Whisper를 출시했을 때, ASR 커뮤니티는 68만 시간의 다국어, 다중 작업, 웹 크롤링 오디오로 훈련되어 사투리, 배경 소음, 기술 용어 전반에 걸쳐
OpenAI가 Whisper를 출시했을 때, ASR 커뮤니티는 680,000시간의 다국어, 다중 작업, 웹 스크래핑 오디오로 훈련된 시스템과 대면해야 했으며, 이 시스템은 강세, 배경 소음, 기술 전문 용어에 상관없이 즉시 작동합니다. 이 리뷰는 Whisper가 GPT-3이 NLP에 한 것을 음성 인식에 할 것인지 판단하고, 대규모 약한 지도 학습이 견고성을 위한 강력한 레시피가 되게 하는 설계 선택을 설명합니다.
이 설명은 인코더-디코더 Transformer 아키텍처, 전사, 번역, 언어 ID, 음성 활동 감지를 단일 모델에 접는 다중 작업 훈련 형식, 그리고 Whisper를 거의 모든 하류 음성 프로젝트에 대한 즉시 기준선으로 전환한 공개 가중치 및 추론 코드를 다룹니다. 이는 또한 설계가 만드는 트레이드오프도 건드립니다: 견고성 및 다국어 지원과 무시할 수 없는 계산 예산 및 배치 지향 추론 방식의 교환입니다. 여전히 자체 Kaldi, ESPnet, 또는 NeMo 파이프라인을 실행 중이고 Whisper로 전환할지 궁금해하거나, 현재 음성 기초 모델을 주도하는 데이터 및 규모 플레이북을 이해하고 싶다면, 다음 아키텍처 결정 전에 이 영상을 시청할 가치가 있습니다.
