[短いレビュー] トレーニング データの重複排除により言語モデルが改善される
あなたの言語モデルの「一般化」のうち、実際にはどれくらいがただの逆流でしょうか?
あなたの言語モデルの「一般化」のうち、実際にはどれくらいがただの逆流でしょうか? Google Research は、これについて数字を発表しました。プロンプトなしの LM 出力の 1% 以上はトレーニング データからそのままコピーされており、C4 のような標準的なコーパスには数万回繰り返される文が含まれています。彼らの論文では、Web スケールのデータセットから重複に近い部分文字列や長く繰り返される部分文字列を削除する 2 つの効率的な重複排除ツールが紹介されており、ダウンストリームに顕著な効果をもたらします。
クリーン化されたデータでトレーニングされたモデルは、学習とテストの重複も急激に減少するため、記憶量が 10 分の 1 に減少し、より少ないステップで収束し、より信頼できる評価値を生成します。会話エージェント用の LLM バックエンドを構築している音声 AI チーム、またはスクレイピングされたTransformerクリプトに基づいて音声言語モデルをトレーニングしている音声 AI チームにとって、これは、データセットの健全性がアーキテクチャの賢さよりも優れていることが多いことを思い出させるものです。この短いレビューでは、重複排除アルゴリズム、記憶測定、およびリリースされたコードについて説明します。データ品質が次のスプリントに近い場合は、5 分の価値があります。
