[Olewaveのレビュー] CLIP (2/3): 自然言語監督から転移可能な視覚モデルを学習する
OpenAIのCLIPは、固定されたラベルセットを廃止し、代わりにインターネットからスクレイピングされた400百万の(画像、テキスト)ペアで訓練することで、コンピュータビジョンのスクリプトを逆転させました。
OpenAI の CLIP は、固定ラベル セットを廃棄し、代わりにインターネットから収集した 4 億個の (画像、テキスト) ペアでトレーニングすることで、コンピューター ビジョンのスクリプトを反転しました。この 3 部構成のレビューのパート 2 では、対照的な画像とテキストの事前トレーニングを機能させる仕組みと、画像にキャプションを一致させることが SOTA 視覚表現への驚くほど効率的な方法であることが判明した理由をさらに深く掘り下げます。音声、テキスト、ビジョンが埋め込みスペースを共有するマルチモーダル システムを構築している人にとって、ここでの設計レッスンはオーディオの世界に直接反映されます (音声テキスト検索用の CLAP、Whisper スタイルの弱い監視、および現在 ICASSP および Interspeech に到達している音声と LLM の調整作業を考えてください)。
この記事では、CLIP がゼロショットを 30 以上の下流ベンチマーク (OCR、アクション認識、地理位置特定、詳細な分類) に転送し、128 万のトレーニング画像に触れることなく、ResNet-50-on-ImageNet の精度を達成する方法について説明します。このディスカッションでは、キュレートされたラベルが行き詰まっている場所で自然言語監視がなぜ拡張されるのか、そして同じ原理が現在、モダリティ全体で基礎モデルを事前トレーニングする方法をどのように再構築しているのかについて説明します。 ASR または TTS の弱い教師ありの事前トレーニングを検討している場合は、この中間の章が成果の出る場所であるため、集中力のある 20 分間の時間があるときにキューに入れてください。
