Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Tutorials

향상된 음성 감정 인식을 위한 Wav2vec 2.0 미세 조정 탐색

음성 감정 인식은 오랫동안 라벨이 붙은 작은 데이터 세트와 손으로 제작한 음향 기능에 갇혀 있었습니다.

음성 감정 인식은 오랫동안 라벨이 붙은 작은 데이터 세트와 손으로 제작한 음향 기능에 갇혀 있었습니다. 이 문서에서는 실용적인 질문을 던집니다. 레이블이 지정되지 않은 오디오에 사전 학습된 wav2vec 2.0 인코더가 실제로 IEMOCAP의 파이프라인을 능가할 수 있습니까? 그렇다면 어떤 미세 조정 방법이 승리할까요? 저자는 부분 미세 조정과 전체 미세 조정, 풀링 전략 및 고정 해제할 transformer 스택의 양을 세심하게 조사합니다.

대답은 당연히 '예'입니다. 사전 훈련은 많은 도움이 됩니다. 하지만 흥미로운 부분은 세부 사항에 있습니다. 어떤 레이어가 감정 구별 정보를 전달하는지, 얼어붙을 때 통증이 있는지, 작은 라벨이 붙은 코퍼스가 어떻게 300M 매개변수 모델을 강력한 특수 기준선을 넘어설 수 있는지 등입니다. 이 연습에서는 훈련 설정, 중요한 절제 및 범용 SSL 모델을 감성 컴퓨팅 작업에 적용하는 모든 사람을 위한 시사점을 다룹니다. 콜센터 분석 도구부터 사용자 기분을 읽는 음성 도우미까지 무엇이든 구축하는 경우 여기의 미세 조정 요령이 직접 전달됩니다.