从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。幻觉重复、沉默段漂移和随音频长度而增加的延迟都是同一基本限制的症状——该模型最初并未为长形式或流式处理设计。本系列的第3部分直面解决这两个问题。
该部分介绍了长音频推理的实践策略:基于VAD的分块、重叠和拼接以避免边界伪影,以及使用前一窗口的文本作为解码器提示来保持上下文流动。在流式处理方面,它涵盖了带前向预报的分块解码、调整延迟和稳定性之间的权衡,以及社区的流式Whisper分支(如whisper-streaming和faster-whisper)实际帮助的地方和您仍需要自定义胶水代码的地方。如果您正在构建实时字幕、会议机器人或任何必须转录长于Whisper感受野的音频的产品,这是系列中值得查看的部分。
