🧠 模型与架构

CLIP

Contrastive Language-Image Pre-trainingCLIP模型OpenAI CLIP

CLIP(Contrastive Language-Image Pre-training)是OpenAI开发的视觉-语言对比预训练模型,通过4亿图文对学习图像与文本的对齐表示,实现零样本图像分类和跨模态检索。


CLIP 简介

CLIP(Contrastive Language-Image Pre-training)由 OpenAI 于 2021 年发布。CLIP 的核心思路是利用自然语言作为监督信号来训练视觉模型,不再依赖人工标注的分类标签。

核心原理

CLIP 采用对比学习框架:使用两个独立的编码器——Image Encoder(ResNet 或 ViT)和 Text Encoder(Transformer)——将图像和文本映射到同一多模态嵌入空间。训练时最大化正样本对的余弦相似度、最小化负样本对的相似度。

零样本迁移

CLIP 最大的亮点是零样本分类能力:将待分类图像的编码结果与所有候选类别的文本描述计算相似度,选择最高分作为预测结果。在 ImageNet 上 CLIP 的零样本准确率达到 76.2%。

影响力

CLIP 是 Vision-Language 领域的里程碑,启发了后续大量工作:DALL-E、Stable Diffusion(以 CLIP 作为文本编码器)、BLIP、ALIGN 等。CLIP 也广泛应用于图像检索、视频理解、多模态 RAG 等场景。


相关术语

分享: