是什么使Olewave的语音数据清洗管道有效且独特
Olewave的Olign管道如何将原始音频转变为生产就绪的ASR/TTS训练数据——经过验证的转录文本、词级时间戳和置信度分数,无需人工标注员。
Olewave最先进且高度可定制的语音数据清洗管道与其语音数据收集管道无缝集成,共同形成Olewave的语音数据策展管道。这个端到端系统经过精心设计,可以大规模提供高质量、一致且成本效益高的语音数据集,适合广泛的下游应用。此外,我们提供大规模、成本效益高的语音数据集,通过我们的管道策展,支持多种语言,涵盖多样化的主题。
Olewave最先进且高度可定制的语音数据清洗管道与其语音数据收集管道无缝集成,共同形成Olewave的语音数据策展管道。
下图展示了我们语音数据清洗管道的流线型工作流程,展现了其将原始、非结构化的语音数据转变为精细、可操作数据集的能力。
我们的管道提供了几个优势:
- 有效:它生成经过验证的说话人标签和转录文本,精确的词级时间戳和不过度自信的置信度分数,相比Whisper和其他开源解决方案更优。
- 健壮性:它处理即席对话语音,包括说话人重叠和包含ASR错误的转录文本的情景。
- 可扩展:它利用可选元数据,并可升级以整合额外模态以提高标签可靠性。管道还支持即插即用集成各种Olewave或客户自有的标签标记模型(例如,情绪、语义等)。
- 效率:它运行速度快且成本效益高,因为它不需要或仅需少量GPU资源。
- 精确突出显示具有准确时间信息的单词,使标注员能够快速定位和审查含糊不清或不清楚的片段,无需重复收听整个音频。
- 引导标注员关注置信度分数在中等范围内的单词,最小化审查每个单词的必要性,简化校正过程。
通过提供这些有针对性的见解,我们的管道提高了效率,减少了手动工作,并确保了更具成本效益的标注工作流程。
以下是管道输出的可视化示例,展示说话人标签、词级时间戳和置信度分数:
图1.对话来自真实交互,不是合成或提示语音。转录文本由人类手动上传,不是由ASR生成。说话人标签也由人类手动添加,不是来自说话人分离算法。随附的JSON文件包括详细转录、说话人时间区间、对话转录、词级时间戳和置信度分数。电话级时间戳和置信度分数可应要求提供。
图2.嘈杂自发语音的后处理示例,每个单词下方的值代表其发音分数,与言语评估密切相关。以下是一些单词分数的解释:a)单词'together':发音类似'togeth-',末尾'-er'未呈现,'-o-'元音持续时间很短,几乎消失。b)开头词'it':虽然频谱图上有摩擦音,但我几乎听不见。它的分数为0.47,表示该词可能缺失。c)末尾插入的词'lt':该人没有说它。这是因为转录文本错误地包含'<'(HTML中使用的'<'符号)。极低的分数0.13表示这是一个插入词,可以通过我们的数据清洗管道删除。
在学术界和工业界广泛公认,大型端到端(E2E)框架和大型E2E ASR模型在生成精确的词级时间戳和可靠的词级置信度分数时存在固有限制。
为了解决这些限制,我们利用了在非端到端语音转文本对齐技术方面的深厚专业知识,并开发了包含元数据信息的复杂程序。这种方法使我们能够从转录文本中有效清洗非言语内容(例如填充词、背景噪音转录),确保最终输出具有更高的准确性和可靠性。
以下是数据管道词级json输出的片段。'speaker'字段表示此录音中说话人的id。'start_time'和'end_time'字段以秒为单位,表示说话人的时间跨度。'block'字段包含来自同一说话人的一个或多个连续话语。每个话语都有自己的开始时间、结束时间、转录、说话人重叠指示器和置信度分数。当'overlap'字段为真时,表示当前片段与相邻片段有说话人重叠。置信度分数范围从0到1。
{
"speaker": 0,
"start_time": "47.18",
"end_time": "49.83",
"block": [
{
"start_time": "47.18",
"end_time": "49.83",
"transcript": "music-related jobs compared to New York and LA.",
"overlap": false,
"word_details": [
{
"start_time": "47.18",
"end_time": "47.53",
"word": "music",
"confidence": "0.97"
},
{
"start_time": "47.53",
"end_time": "47.89",
"word": "related",
"confidence": "0.79"
},
{
"start_time": "47.89",
"end_time": "48.44",
"word": "jobs",
"confidence": "0.98"
},
{
"start_time": "48.44",
"end_time": "48.90",
"word": "compared",
"confidence": "0.96"
},
{
"start_time": "48.90",
"end_time": "48.96",
"word": "to",
"confidence": "0.17"
},
{
"start_time": "48.96",
"end_time": "49.08",
"word": "new",
"confidence": "0.97"
},
{
"start_time": "49.08",
"end_time": "49.37",
"word": "york",
"confidence": "0.98"
},
{
"start_time": "49.37",
"end_time": "49.49",
"word": "and",
"confidence": "0.92"
},
{
"start_time": "49.49",
"end_time": "49.83",
"word": "la",
"confidence": "0.56"
}
]
}
]
},
