[EnCodec의 리뷰] 구성 E2E 모델을 사용한 RVQ의 토큰 수준 시퀀스 라벨링
엔드 투 엔드 SLU는 잠시 시간을 보내고 있지만 시퀀스 라벨링을 시퀀스 예측으로 취급하면 수십 년 동안 잘 이해되었던 토큰 수준 태깅 기계가 조용히 폐기됩니다.
엔드 투 엔드 SLU는 잠시 시간을 보내고 있지만 시퀀스 라벨링을 시퀀스 예측으로 취급하면 수십 년 동안 잘 이해되었던 토큰 수준 태깅 기계가 조용히 폐기됩니다. 이 문서에서는 E2E의 단순성을 유지하면서 토큰 수준 공식을 다시 제공하고 CRF 스타일 전역 정규화 손실과 깔끔한 구성 요소별 성능 모니터링을 갖춘 구성적인 엔드 투 엔드 SLU 설계를 제안합니다. 직접 E2E에 대해 계단식 ASR-plus-NLU 파이프라인을 고려하는 팀의 경우 이는 실용적인 중간 경로입니다.
비결은 NLU 태거가 실행되기 전에 음성을 토큰 수준 표현으로 변환하는 중간 ASR 학습 디코더를 삽입하는 것입니다. 따라서 하드 캐스케이드의 오류 전파 세금을 지불하지 않고도 사전 학습된 ASR 및 NLU 구성 요소와의 호환성을 상속받을 수 있습니다. SLU 벤치마크의 명명된 엔터티 인식에서 구성 모델은 계단식 및 직접 E2E 기준을 모두 능가했습니다. 심층 분석에서는 아키텍처, 교육 신호 설계, 전역적으로 정규화된 CRF 손실 슬롯을 다시 그림에 적용하는 방법, 프로덕션에서 실제로 디버깅해야 할 때 구성 요소별 성능 모니터링이 중요한 이유를 살펴봅니다. 음성 도우미, 콜센터 분석 또는 ASR 위에 슬롯 채우기 및 의도 감지가 포함된 제품을 출시하는 경우 구성 E2E가 로드맵에 있을 때 주의 깊게 살펴볼 가치가 있습니다.
