[Long Review] Deduplicating Training Data Makes Language Models Better

Tutorials

【長評】訓練資料去重讓語言模型變得更好

重複資料刪除聽起來很無聊,直到您了解到單個 61 個單字的句子在 C4 中出現了 60,000 多次,並且在此類語料庫上訓練的語言模型將訓練集文字以令人不安的方式傳回給使用者。

重複資料刪除聽起來很無聊,直到您了解到單個 61 個單字的句子在 C4 中出現了 60,000 多次,並且在此類語料庫上訓練的語言模型以令人不安的規律性向用戶吐出訓練集文字。這篇對 Google 論文《訓練資料去重使語言模型更好》的長篇評論深入探討了近重複檢測和長子串匹配如何重塑現代 LLMs 的損失情況、記憶行為和評估有效性。

期待仔細瀏覽兩個提議的重複資料刪除管道、使它們在網路規模上易於處理的後綴數組技巧,以及證明更乾淨的資料可以減少十倍的記憶量以及更快地收斂到相同或更好的精度的經驗證據。對於語音 AI 從業者微調 LLMs 進行對話,或在大量轉錄語料庫上訓練語音基礎模型而言,該訊息可直接翻譯:洩漏的評估語句和複製貼上產生從重複的訓練行開始。如果數據管道決策落在您的辦公桌上,那麼深入研究就值得您花費一個下午的時間。