Olign,Olewave 柳叶刀般精准的语音转文字强制对齐服务
发送一段录音,同时附上它的文字稿或 ASR 结果。两者都没有时,Olign 会自行转写音频。每个词和每个音素都会返回起止时间,以及 0 到 100 的分数。它的词级时间戳比 Montreal Forced Aligner、Qwen3-ForcedAligner 和 WhisperX 给出的更准确。
https://api.olewave.com/olign/v1
免费公测已开放。申请邀请码并创建你自己的 API 密钥。
词级时间戳往往没有看上去那么准确。在 FA-Bench 论文中,Whisper 会把词的位置标得约提早 150 ms。八个商用语音转文字 API 中有七个把词的起点标得偏晚,其中三个偏晚超过 50 ms。强制对齐器的失败方式不一样。在加入背景噪声的 Buckeye 测试集上,Montreal Forced Aligner 3.4 对 4,513 条语句中的 354 条没有返回任何对齐结果。
我们打造 Olign,是为了在真实录音上准确标出词边界,包括嘈杂的录音。
所有强制对齐器中最高的边界 F1
给定相同的文字稿,Olign 标出的词边界比 FA-Bench 评测的所有其他强制对齐器都更准确。两个语料库都是如此,无论是干净音频还是加入噪声后的音频。在 TIMIT core-test 上,它的词边界 F1 为 0.782,Montreal Forced Aligner 3.4 为 0.644。它标出的词起点平均提早 3.1 ms。F1 是该基准的主要指标,因为它会把系统未能标出的每个词都计算在内。平均绝对误差会把这些词排除在外。
为你现有的 ASR 提供更准的时间标注
保留你现有的语音识别系统,让 Olign 为它识别出的词标注时间。把 Google Chirp 2 在 TIMIT core-test 上识别出的词交给 Olign,这些词的边界 F1 从 0.443 提升到 0.734。识别出的词没有变化,所以全部提升都来自时间标注。以这种方式运行时,Olign 在每个数据划分上的时间戳都优于基准中全部八个商用 API。
在嘈杂音频上依然可靠的对齐结果
在 Buckeye 测试集上,无论是干净音频还是四种劣化条件下的音频,Olign 对 22,565 条语句中除 3 条之外的语句都返回了对齐结果。Montreal Forced Aligner 3.4 有 573 条没有返回任何结果。
可以自行核对的数字
本页的每个结果都来自 FA-Bench,它是开源的,相关论文发布在 arXiv 上。产出这些已发布数字的 v0.9 API 仍然可用,所以你可以复现这些数字,也可以用同一个基准评测你当前使用的系统。
音频不能离开你的网络时,可以自托管
如果你的录音必须留在你自己的 VPC 内,我们可以讨论自托管部署方案。
FA-Bench 上的词级时间戳准确度
fabench 协议,在 10 ms 网格上进行,并给出 bootstrap 95 % 置信区间。四个系统都在金标准文字稿赛道中运行,因此每个系统拿到的都是参考词,只衡量它的时间标注。这些数字里不含任何识别错误。两个数据划分都是留出集,且说话人互不重叠。TIMIT core-test 按语料库文档的要求排除了 SA 句子。Buckeye 测试集按该语料库自身的性别与年龄交叉设计分层,覆盖 24、8 和 8 位说话人。逐条语句的归属已提交到代码仓库中。“嘈杂”是四种劣化条件的平均值,这四种条件分别是混响、噪声、音乐和多人交谈声。基线系统是 Montreal Forced Aligner 3.4.1、Qwen3-ForcedAligner-0.6B 和 WhisperX 3.8.6。TIMIT 和 Buckeye 的完整结果。免费公测现已开放,支持美式英语和英式英语,更多语言在计划中。申请邀请码,创建你的 API 密钥,然后以任务形式发送最长 60 分钟的完整录音。公测期间每个账户每天可处理 60 分钟音频,一个任务的运行时间约为录音时长的八分之一。本页的准确度数据均在美式英语上测得。
申请公测资格 · FA-Bench 论文 · FA-Bench 代码 · 客户端库
