[Long Review] Deduplicating Training Data Makes Language Models Better

Tutorials

[ロングレビュー] 訓練データの重複排除により言語モデルが向上する

重複排除は退屈に聞こえるかもしれませんが、61語の単一文がC4内に60,000回以上出現すること、そのようなコーパスで訓練された言語モデルがユーザーに訓練セットテキストを不気味に

重複排除は退屈に聞こえるかもしれませんが、61語の単一文がC4内に60,000回以上出現し、そのようなコーパスで訓練された言語モデルが訓練セットテキストをユーザーに不気味な規則性で吐き出すことを知るまでは。Google論文「訓練データの重複排除により言語モデルが向上する」についてのこの長形式レビューは、近傍重複検出と長い部分文字列マッチングが現代のLLMsの損失ランドスケープ、記憶化行動、および評価妥当性をどのように変えるかについて掘り下げています。

提案された2つの重複排除パイプラインの慎重なウォークスルー、それらをウェブスケールで実現可能にするサフィックス配列トリック、およびより清潔なデータが記憶化を10分の1に削減し、等しいまたはより良い精度への高速な収束をもたらすことの経験的証拠を期待してください。対話のためにLLMsを微調整したり、トランスクリプトが多いコーパスで音声基盤モデルを訓練したりする音声AI実践者にとって、メッセージは直接的です: 漏洩した評価文とコピー・ペースト生成は重複訓練行に起因します。データパイプラインの決定があなたのデスクに着く場合、この深掘りはあなたの午後の価値があります。