[Long Review] Towards Zero-Label Language Learning

Tutorials

[长评]走向零标签语言学习

如果您可以在没有单个人工标记示例的情况下训练特定于任务的 NLP 模型,结果会怎样? 《走向零标签语言学习》深入探讨了这个问题。

如果您可以在没有单个人工标记示例的情况下训练特定于任务的 NLP 模型,结果会怎样? 《走向零标签语言学习》深入探讨了这个问题。诀窍是无监督数据生成(UDG),它在大型预训练语言模型(如 GPT-3)上使用几次提示来合成自己的训练集,然后纯粹根据该合成数据微调下游模型。

这篇长篇评论详细介绍了 UDG 管道及其令人惊讶的结果:仅在合成数据上训练的模型匹配或击败在真实人类注释上训练的基线,并且当您将合成数据与标记数据混合作为增强时,该方法会在 SuperGLUE 上设置新的最先进的数字。对于语音和语音 AI 团队来说,影响是直接的,这是用于意图分类、语义解析以及人工注释成为瓶颈的任何下游 NLU 任务的引导标签的剧本。如果您正在规划下一个合成数据管道,那么深入研究将贯穿每一个部分。