[ロングレビュー] ゼロラベル言語学習に向けて
人間がラベルを付けたサンプルを 1 つも使用せずに、タスク固有の NLP モデルをトレーニングできたらどうでしょうか? 「ゼロラベル言語学習に向けて」は、その疑問に真剣に取り組んでいます。
人間がラベルを付けたサンプルを 1 つも使用せずに、タスク固有の NLP モデルをトレーニングできたらどうでしょうか? 「ゼロラベル言語学習に向けて」は、その疑問に真剣に取り組んでいます。秘訣は教師なしデータ生成 (UDG) です。これは、GPT-3 のような大規模な事前トレーニング済み言語モデルで少数のショット プロンプトを使用して独自のトレーニング セットを合成し、その合成データのみに基づいてダウンストリーム モデルを微調整します。
この長いレビューでは、UDG パイプラインとその驚くべき結果を詳細に説明します。合成データのみでトレーニングされたモデルは、実際の人間のアノテーションでトレーニングされたベースラインと一致または上回ります。また、合成データとラベル付きデータを拡張として混合すると、このアプローチは SuperGLUE で新しい最先端の数値を設定します。音声および音声 AI チームにとって、その影響は直接的であり、これは、意図分類、セマンティック解析、および人間による注釈がボトルネックとなるダウンストリーム NLU タスク用のラベルをブートストラップするためのプレイブックです。次の合成データ パイプラインを計画している場合は、詳細をすべて確認してください。
