[Olewave's Review] CLIP (1/3):从自然语言监督中学习可迁移的视觉模型
在 BLIP、LLaVA 或任何有价值的演讲 LLM 出现之前,就已经出现了 CLIP,这就是故事的开始。
在 BLIP、LLaVA 或任何有价值的演讲 LLM 出现之前,就已经出现了 CLIP,这就是故事的开始。这篇由三部分组成的评论的第 1 部分设置了 OpenAI 的对比图像文本预训练配方:从开放网络中提取的 4 亿对(图像、文本)、双编码器架构以及像“哪个标题与哪个图像搭配?”这样简单的训练目标。其结果是可转移视觉表示的一步改变,以及语音人工智能团队现在借鉴的许多多模式基础模型工作的蓝图。
该评论列出了放弃固定类别监督的动机、400M 对数据集背后的数据管理策略,以及让单个预训练过程泛化到 OCR、动作识别、地理定位和细粒度分类的训练时间技巧。 CLIP 与 ResNet-50 的零样本 ImageNet 比赛,没有触及任何 1.28M ImageNet 训练图像,是主要结果,但更深层的结论是架构:自然语言作为监督信号的缩放方式是标记数据根本无法做到的。如果您想在进入第 2 部分和第 3 部分之前奠定基础,请点击“播放”,特别是如果您正在尝试为目前正在吞噬语音 AI 堆栈的音频文本和语音 LLM 预训练配方建立相同的直觉。
