回顾微软的 VALL-E 2(在零样本 TTS 中实现人类同等水平)
零样本 TTS 刚刚跨越了一条许多人认为还需要几年时间才能实现的界限:Microsoft 的 VALL-E 2 是第一个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和语音方面达到人类同等水平的神经编解码器语言模型
回顾DiTAR:扩散Transformer 用于语音生成的自回归建模〜Seed-TTS
Seed-TTS 团队带着 DiTAR 回来了,这是对现代语音生成中更尴尬的权衡之一的干净答案:如何在不支付 comp
从“ESPnet”“Llama 3”到您的内部“SDK”服务:识别名称实体和特定于域的术语
Whisper开箱即用令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语以及整个长尾领域词汇表时会出错
Meta 的 Movie Gen 与 OpenAI 的 Sora:详细回顾
Meta终于对Sora出手,Movie Gen不仅仅是一个视频生成器——它是一套基础模型,可以跨多个宽高比生成1080p高清视频,配备同步音频,支持精
推演OpenAI GPT-4o的神经网络架构
OpenAI尚未发表关于GPT-4o的论文,所以该视频做了次好的事情:根据OpenAI实际演示的能力对神经网络架构进行反向工程,几乎肯定看起来像
Google 针对 100 多种语言的通用语音模型击败了 OpenAI 的 Whisper 模型
谷歌的通用语音模型默默地做了一些非常出色的事情:在100多种语言上匹配或击败了OpenAI的Whisper ASR,同时使用的标注训练数据大约是其七分之一。
长篇回顾:Apple 的 MM1:多模式 LLM 预训练的方法、分析和见解
苹果不发表太多内容,所以当MM1论文发布时,带有关于多模态LLM预训练的完整消融研究,这对于任何构建MLLM的人来说都是该年更有用的数据发布之一。
快速回顾 Apple 的 SOTA Multimodal LLM:MM1
如果你没有时间深入了解完整的MM1分析,这个快速回顾能在几分钟内为你提供要点:Apple构建了什么、他们从架构和数据的消融实验中学到了什么,以及哪些设计决策a
使 Claude 成为 3 号王牌 GPT-4 的秘密
当Claude 3 Opus在MMLU、GPQA、GSM8K和大多数前沿评估基准上略胜GPT-4时,有趣的问题不是Anthropic是否仅通过更多资源来扩展——而是什么训练阶段的秘密配方
变分自动编码器 (VAE) 和重新参数化技巧 - 重新审视经典生成模型
在扩散模型之前,在归一化流之前,在潜在扩散模型悄悄地将 VAE 编码器嵌入到每个严肃的生成堆栈之前——有 Kingma 和 Welling 的 2013 年论文介绍变分自编码器
对“Microsoft”+“ESPnet”、Google、“VCTK”和“ICASSP”的“SDK”开源大型语音模型的回顾
每个主要的 AI 实验室现在都已经发布了一个用于 ASR 的开源大型语音模型,为生产选择合适的模型已成为一个真正需要做出的决策。
【论文详细阅读】Zipformer:一种更快更好的自动语音识别编码器
Conformer 多年来一直是默认的 ASR 编码器,但 k2/icefall 团队的 Zipformer 悄然赢得了 LibriSpeech、Aishell-1 和 WenetSpeech 上的 WER 冠军,同时速度更快、体积更小。
第谷:用于构建高投资回报率内部语音相关服务的 takeit(ASR/TTS/翻译):概述
大多数想要拥有内部 ASR、TTS 或语音翻译服务的团队都面临同样混乱的选择:将 ESPnet、NeMo、k2 和 HuggingFace 的片段粘合在一起,或把所有内容交给云 API 永久按分钟支付
从“ESPnet”的“Llama 3”模型到您自己的内部“SDK”服务:后处理和语言建模
未经处理的 Whisper 输出开箱即用令人印象深刻,但任何已将其用于真实用户的人都知道演示记录和下游系统可以实际使用的内容之间存在的差距。
从“ESPnet”的“Llama 3”型号到您自己的内部“SDK”服务:长音频和流媒体(第 3 部分)
Whisper 是在 30 秒的音频块上训练的,当你向其输入两小时的播客或尝试将其接入实时字幕管道时,这一点就凸显了。
从 OpenAI 的 Whisper 型号到您自己的内部 ASR 服务:ROI(投资回报率)(第 2 部分)
ASR的构建与购买问题通常被定位为准确性与便利性之间的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么 OpenAI Whisper 生成的单词时间戳不准确?如何让它们再次准确?
向 Whisper 询问单词时间戳,您会得到数字 - 但如果您曾经尝试将它们与卡拉 OK、字幕或配音的实际音频对齐,您就会知道它们会漂移、捕捉到错误的边界,并且有时会出现错误。
LoRA:允许高中生使用游戏显卡训练大型语言模型(GPT-3)
对 175B 参数 GPT-3 进行全面微调几乎对每个人来说都是不可能的——仅存储就排除了这种可能性,更不用说 GPU 了。
SpeechT5 回顾:将 Google 的 T5 引入语音(ASR、TTS、SID,...)任务
T5 在单个编码器-解码器预训练方案下统一了文本到文本任务,并成为 NLP 的主力。
对 Deepmind 的 WaveNet 用于 TTS/音频合成的回顾(你觉得它像 GPT 吗?)
在 Tacotron 之前,在 VALL-E 之前,在神经编解码器将音频转换为令牌之前,DeepMind 的 WaveNet 论文表明神经网络可以逐个样本生成原始音频波形,并击败每个参数
HiFi-GAN综述:用于高效高保真语音合成的生成对抗网络
长期以来,神经声码器迫使您选择一边:像 WaveNet 这样的自回归模型可以为您提供华丽的音频,但速度慢得令人痛苦,而基于 GAN 的波形生成器速度很快,但质量明显较低。
公开 OpenAI GPT-4 的视觉+文本模型、数据和训练成本(推测)
众所周知,OpenAI 拒绝透露 GPT-4 的架构、参数计数、训练数据或计算预算,这使得该技术报告变成了 ML 社区的罗夏墨迹测试。
