[ショートレビュー] ゼロラベル言語学習へ向けて
何ヶ月もかけてアノテーションしたラベル付きデータが、実は必要なかったとしたら?
何ヶ月もかけてアノテーションしたラベル付きデータが、実は必要なかったとしたら?Googleの「ゼロラベル言語学習へ向けて」はこの問題提起を強く推し進め、大規模言語モデルがタスク説明と数個のインコンテキスト例のみから独自の合成訓練セットを生成できることを示しています。その結果は、モデルが自分自身で発明したデータに対してより小さい学生モデルを教え、学生がSuperGLUEで完全に教師あり学習のベースラインに対抗する、というパイプラインです。
質の高い(しかし小規模な)ラベル付きコーパスを保有する音声AIチームにとって、その含意は明確です:教師なしデータ合成がNLUでこれほど効果的に機能するなら、同様のトリックで意図分類器、スロットフィラー、またはASR後処理のドメイン適応を、新しいアノテーション契約なしでブートストラップできる可能性があります。このショートレビューはプロンプトベースのデータ生成ループ、蒸留セットアップ、およびその主張を信頼できるものにする数字を説明します。ゼロラベルデータパイプラインがロードマップにある場合は、素早く確認してみてください。
