十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

VLM发展路线(概述)

VLM发展路线(概述) 实际上VLM的发展可以总结成一句话从“让模型看懂图文关系” → “让模型拥有视觉能力” → “让大语言模型理解视觉” → “让视觉语言模型成为通用助手”。一、VLM发展的四个阶段整个路线可以分成阶段时间核心问题代表论文阶段1视觉-语言对齐2021图片和文字如何建立联系CLIP阶段2视觉语言预训练2022如何同时理解、生成、多任务学习BLIP、Flamingo阶段3视觉连接LLM2023如何让LLM获得视觉能力BLIP-2、InstructBLIP、LLaVA阶段4大规模通用多模态模型2023-2024如何成为GPT-4V一样的通用助手Qwen-VL、InternVL、Florence-2第一阶段CLIP(2021) 找到视觉和语言的共同空间背景2020年前后的视觉模型CNN/ViT输入图片 → 分类标签问题模型只能识别固定类别。所以OpenAI提出能不能直接利用互联网的图片文本让模型学习世界概念于是CLIP出现。核心思想不预测类别。而是Image-Text Contrastive Learning学习图片 → Image Encoder 二者映射到同一个空间 文本 → Text Encoder解决了如何让视觉和语言对齐的问题但不会生成文字、不会聊天、不理解复杂指令所以CLIP更像视觉世界 → 语言空间而不是一个助手。第二阶段BLIP (2022) —— 从“对齐”走向“理解”CLIP的问题图片和文字只是匹配。但是VLM需要看图回答问题、图片描述、视觉推理所以需要更强的视觉语言预训练。核心思想同时训练理解任务和生成任务。提出MED模型Multimodal Mixture of Encoder-Decoder一个模型三个身份1. Image-Text Contrastive Learning类似CLIP图片和文字靠近。2. Image-Text Matching判断图片和文本是否匹配二分类3. Image Captioning所以BLIP比CLIP多了一步CLIP图片 ↔ 文本BLIP图片 ↔ 文本理解↓文本生成BLIP最大的贡献不是结构。而是提出CapFilt 数据过滤机制互联网图片图片 垃圾文本 很多BLIP用Captioner生成高质量captionFilter过滤错误caption得到 clean image-text pairs成为后来大量VLM的数据构建基础。Flamingo(2022)让LLM“看图”CLIP视觉理解强BLIP视觉语言任务强但它们不是LLM。问题能不能直接把视觉能力接到GPT这种语言模型核心思想保持LLM参数冻结通过增加视觉编码器和视觉-语言交互模块将视觉信息注入LLM使LLM具备视觉理解能力。结构Image | Vision Encoder | Perceiver Resampler | Visual Tokens ↓ LLM关键Cross Attention原本LLMText → Self AttentionFlamingoText token → Cross Attention ← Image feature让语言模型读取图片。Flamingo解决了如何让大语言模型拥有视觉输入能力但是训练成本高因为需要大量LLM结构修改。Flamingo没有改动预训练视觉模型Vision Encoder的主体也没有重新训练LLM的主体参数但是它改造了LLM结构在LLM中插入了新的Cross-Attention模块并训练这些新增模块。第三阶段BLIP-2 —— 最经典的桥接思想Flamingo的问题需要训练大量参数。BLIP-2提出能不能不用改视觉模型也不用改LLM答案增加一个桥。Flamingo 的思路是冻结视觉编码器 冻结语言模型然后在语言模型内部插入大量可训练的 Gated Cross-Attention 层参数量大。BLIP-2更激进地压缩了要训练的部分把“桥”集中到Q-Former主要训练Q-Former 投影层。Q-Former 本身只有大约188M 参数且LLM 完全冻结不需要像 Flamingo 那样在 LLM 的多层结构中增加一套 Cross-Attention 模块。结构核心Q-Former负责视觉特征 → LLM能够理解的语言空间Flamingo选择把视觉信息通过Gated Cross-Attention直接注入语言模型内部的多层网络BLIP-2则把视觉信息先交给Q-Former提炼成少量query表示再作为LLM的输入前缀/视觉token送入LLM。所以CLIP视觉 ↔ 文本BLIP视觉 ↔ 语言任务Flamingo视觉 → LLMBLIP-2视觉 → QFormer → LLMInstructBLIP(2023)让模型听懂任务BLIP-2的问题会看但是不知道 “你现在让我做什么”。如图片狗问题1这是什么动物 回答狗问题2描述图片 回答一只狗在草地。BLIP-2没有明确任务意识。InstructBLIP加入Instruction tuning输入Image Instruction:Describe this image输出A dog running...用预训练的 BLIP-2 初始化训练在指令调整期间冻结图像编码器和 LLM只微调Q-Former。核心Q-Former增加instruction输入。所以BLIP-2视觉→语言InstructBLIP视觉任务→语言LLaVA(2023)视觉指令微调路线LLaVA其实和InstructBLIP路线不同。它的问题能不能像ChatGPT一样训练一个视觉聊天机器人结构Image ↓ CLIP Vision Encoder ↓ Linear Projection ↓ Vicuna/LLaMA ↓ Answer非常简单。关键创新Visual Instruction Tuning制作图片问题答案例如图片猫生成Human: What is in the image? Assistant: There is a cat.训练LLM学会看图聊天。区别BLIP-2的假设Vision Encoder虽然强但视觉特征和LLM语言空间差距大需要一个强大的桥。LLaVA的假设CLIP已经学好了视觉语义只需要一个简单映射让LLM能读懂即可。BLIP-2重点更好的视觉-LM连接方式Q-FormerLLaVA重点更简单的连接方式 大规模视觉指令数据让LLM获得视觉对话能力BLIP-2认为connector本身需要具备视觉理解能力LLaVA认为connector只需要负责维度映射把视觉理解能力交给CLIP把推理能力交给LLM。第四阶段大规模通用VLM前面模型规模有限、数据有限。GPT-4V出现后目标变成一个模型解决所有视觉任务。Qwen-VL核心中文大模型路线。基础Qwen-LM增加Visual Receptor视觉编码器Input-output interface视觉token接口例如image 图片token /image让LLM知道这里有图片。训练三个阶段图文对齐、多任务预训练、指令微调InternVL核心提高视觉理解能力。路线InternViT QLLaMA 大规模数据重点视觉编码器扩大。因为发现很多VLM瓶颈不是LLM而是视觉理解不足。所以InternVL强化Vision Encoder。Florence-2(2024)它代表另一条路线不做聊天模型而做统一视觉基础模型。目标一个模型完成caption、detection、segmentation、grounding、OCR核心统一序列生成。如检测输出loc_1loc_2分割输出mask token。所以Florence-2更像视觉领域GPT。最终形成三条路线路线1CLIP路线目标视觉语言对齐代表CLIP → BLIP路线2LLM增强路线目标让LLM看懂图片代表Flamingo → BLIP-2 → InstructBLIP → LLaVA路线3通用视觉基础模型路线目标一个模型解决所有视觉任务代表Qwen-VL、InternVL、Florence-2最后一张总图视觉语言模型发展 图片文本如何关联CLIP(2021) | 图文理解生成能力BLIP(2022) | 让LLM拥有视觉 / \ Flamingo BLIP-2 | | 视觉Cross Attention Q-Former桥接 | Instruction能力 | InstructBLIP | Visual Instruction Tuning | LLaVA | 大规模通用多模态模型 / | \ Qwen-VL InternVL Florence-2真正需要记住的不是9个模型而是4个关键问题CLIP视觉和语言怎么对齐BLIP怎么做统一视觉语言预训练BLIP-2/LLaVA怎么让LLM获得视觉能力Qwen-VL/InternVL/Florence-2怎么做通用多模态基础模型
返回列表