十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

CLIP 完整入门指南:图文匹配如何做到零样本分类

CLIP 完整入门指南:图文匹配如何做到零样本分类 CLIP 完整入门指南图文匹配如何做到零样本分类【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIPCLIPContrastive Language-Image Pre-training是 OpenAI 推出的图文匹配模型它把图片和文字编码进同一个向量空间让一张狗的照片这样的句子能直接和图片对上号从而不用任何标注数据就能做零样本分类。本文面向会跑 Python 脚本的新手带你 10 分钟看懂 CLIP 的核心机制。这张图就是 CLIP 的全部。左侧绿色 Image Encoder 负责看图紫色 Text Encoder 负责读句中间是 N×N 的相似度矩阵。图 1 是训练时的对比预训练图 2 和 3 展示了同一个技巧的用法把每个类别名包进固定句式A photo of a {object}谁的向量最接近图片谁就是预测结果。下文按数据流依次拆四个环节。 先解决匹配问题图文对是怎么配对出来的CLIP 的训练数据是 4 亿组图片描述配对。训练时一张图片要和同一批里另外上千组描述混在一起模型必须从里面挑出真正属于自己那条。配对的靠得更近错配的推得越远越好——重复几亿次之后狗这个词的向量自然就和狗的图片站到了一起。这就是对比学习的名字来源。没有代码可看因为这套机制就发生在训练阶段推理时只剩一个副产品两个编码器输出可以直接算相似度的向量。一句话小结CLIP 不是被教会分类的而是被海量配对喂出图文对齐能力的。 把任意长的句子压进 77 个格子模型只能吃固定长度的整数序列而自然语言有长有短。CLIP 用 BPE字节对编码把词拆成子词单元再查表换成数字 ID。像 dog 这种高频词直接占一个格子生僻词会被拆成几段。整个过程由 clip/clip.py 里的tokenize()完成sot_token _tokenizer.encoder[|startoftext|] eot_token _tokenizer.encoder[ /output /parameter /function /tool_call【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表