FA-Bench: A Benchmark for Evaluating Phone- and Word-Level Timestamp Accuracy in Forced Aligners
Most forced aligner benchmarks aren't reproducible. FA-Bench establishes a standardized baseline — phone- and word-level boundary accuracy against hand-label...
评测 Microsoft 的 VALL-E 2(在零样本 TTS 中实现人类水平)
零样本 TTS 刚刚越过了许多人认为还需要多年才能跨越的界线:Microsoft 的 VALL-E 2 是首个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和说话人
是什么使Olewave的语音数据清洗管道有效且独特
Olewave的Olign管道如何将原始音频转变为生产就绪的ASR/TTS训练数据——经过验证的转录文本、词级时间戳和置信度分数,无需人工标注员。
从OpenAI Whisper到您的自研ASR服务:识别命名实体和特定领域术语
开箱即用的Whisper令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语和整个特定领域词汇的长尾部分时容易出错
Google 通用语音模型胜过 OpenAI 的 Whisper 模型,支持 100+ 种语言
Google 通用语音模型悄然做了一件了不起的事情:在 100+ 种语言的 ASR 上与 OpenAI 的 Whisper 相当或超过,同时使用大约七分之一的标注训练数据
长篇评测:Apple的MM1:多模态LLM预训练的方法、分析和见解
Apple不经常发表论文,所以当MM1论文发布时,其中包含了关于多模态LLM预训练的完整消融研究,这是今年对任何构建MLLM的人来说最有用的数据发布之一。
Apple的SOTA多模态LLM快速评测:MM1
如果你没有时间进行完整的MM1分解,这个快速评测会在几分钟内为你提供要点:Apple构建了什么,他们从架构和数据消融中学到了什么,以及哪些设计决策
让Claude 3超越GPT-4的秘密
当Claude 3 Opus在MMLU、GPQA、GSM8K和大多数前沿评测基准上击败GPT-4时,有趣的问题不是Anthropic是否只是规模更大——而是什么秘诀真正让他们做到了这一点。
Microsoft+OpenAI、Google、Meta和Nvidia开源大型语音模型ASR评测
如今每个主要的AI实验室都推出了开源大型语音模型用于ASR,为生产系统选择合适的一个已成为真正的决策问题。
[详细论文解读] Zipformer:自动语音识别的更快更优编码器
Conformer多年来一直是默认的ASR编码器,但k2/icefall团队的Zipformer在LibriSpeech、Aishell-1和WenetSpeech上悄悄夺得WER冠军,同时更快更轻。
从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
从OpenAI的Whisper模型到自研ASR服务:ROI(投资回报率)(第2部分)
对于ASR,'自建还是购买'的问题通常被框架化为准确性与便利性的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
[Olewave评论] 使用组合式端到端模型进行SLU的Token级序列标签
端到端SLU正在蓬勃发展,但将序列标签视为序列预测却悄悄地丢弃了数十年来被充分理解的token级标签机制。
[Olewave的评论] Branchformer:并行MLP-注意力架构和E-Branchformer
Conformer多年来一直是ASR编码器的标杆,但Branchformer及其后续产品E-Branchformer有力地论证了顺序卷积加注意力并不是唯一的路径。
非冲突误发音添加(NCMA)用于口音ASR
带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
Olewave的最详细RNN-T说明:使用递归神经网络进行序列转导
Alex Graves的RNN-T论文是如今几乎所有流式ASR系统的隐形祖先,从Google的设备端识别器到NeMo、ESPnet等中的无数开源转导器堆栈。
[Olewave的长篇评论] 语音识别神经转导器的高效训练
神经转导器是流式ASR的主力,但有效地训练它们是出了名的痛苦:RNN-T损失在序列长度上具有立方内存,对齐格在长语音上爆炸,而单
