十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解

InternVL3.5-4B架构深潜:InternViT+Qwen3的ViT-MLP-LLM多模态范式逐层拆解 InternVL3.5-4B架构深潜InternViTQwen3的ViT-MLP-LLM多模态范式逐层拆解【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4BInternVL3.5-4B 是 OpenGVLab 开源的轻量级多模态大模型总参数量约 4.7B采用经典的「ViT-MLP-LLM」架构InternViT-300M 视觉编码器 MLP 投影层 Qwen3-4B 语言模型。本文逐层拆解这套多模态范式的实现细节讲清它如何把一张图片变成视觉 token 序列并交给 LLM帮助新手彻底看懂轻量级 VLM 的架构原理。 30 秒概览三个「零件」拼成一个模型组件模型参数量职责视觉编码器InternViT-300M0.3B切图、提取视觉特征投影层Pixel Shuffle MLP约几 M压缩视觉 token、对齐维度语言模型Qwen3-4B4.4B多模态理解、推理与生成关键数字每个 448×448 图像切片最终转换为256 个IMG_CONTEXT视觉 token一张原图会被动态切成1~12 个切片 1 张缩略图见config.json中的max_dynamic_patch12、downsample_ratio0.5。 数据流全景一张图如何变成回答动态切图按最接近的宽高比把原图切成 1~12 个 448×448 切片再附一张缩略图视觉编码每个切片进入 InternViT24 层 Transformer448÷1432得到 32×321024 个 patch 特征 1 个 CLS tokentoken 压缩pixel shuffle 把 1024 个 token 压成 256 个每个 token 维度变为 4 倍投影对齐mlp1把 4096 维映射到 Qwen3 的 2560 维占位替换输入 embedding 序列中的IMG_CONTEXT占位符逐个换成视觉特征见modeling_internvl_chat.py的forward自回归生成Qwen3-4B 基于「文本 视觉」混合序列生成回答。 第一层InternViT 视觉编码器实现在modeling_intern_vit.py关键参数来自config.json的vision_config段参数值含义num_hidden_layers24Transformer 层数hidden_size1024隐层维度num_attention_heads16注意力头数patch_size14切片窗口大小像素image_size448每个切片分辨率hidden_act / normgelu / layer_norm激活与归一化方式几个值得留心的设计细节可插值位置编码_get_pos_embed用双三次插值把 32×32 的位置编码表重采样因此任意尺寸的切片都能拿到合适的位置信息LayerScale DropPath每层带ls1/ls2缩放参数和随机深度drop_path_rate0.1让大视觉编码器训练更稳FlashAttention 加速配置了use_flash_attntrue自注意力走flash_attn_varlen_qkvpacked_func快速路径。「动态高分辨率」由config.json中dynamic_image_sizetrue、min_dynamic_patch1、max_dynamic_patch12、use_thumbnailtrue共同控制小图只切 1 块信息量大的图表、文档则最多切 12 块「看得更仔细」兼顾精度与开销。 第二层MLP 投影层——视觉与语言之间的「翻译官」这是 ViT-MLP-LLM 中「MLP」的核心位于modeling_internvl_chat.py的InternVLChatModel.__init__pixel shuffledownsample_ratio0.5把 32×32 网格的 1024 维特征重排为 16×16 网格的 4096 维特征token 数从 1024 压到 256序列长度骤降 4 倍mlp1LayerNorm(4096) → Linear(4096→2560) → GELU → Linear(2560→2560)完成到 Qwen3 隐层维度的对齐。算一笔账一张 12 切片 缩略图的图像会注入 256×13 3328 个 token——这就是多模态对话为什么特别「吃」上下文窗口的原因。 第三层Qwen3-4B 语言模型参数定义在config.json的llm_config段架构为Qwen3ForCausalLM参数值参数值num_hidden_layers36hidden_size2560num_attention_heads32num_key_value_heads8GQAintermediate_size9728max_position_embeddings40960rope_theta1,000,000vocab_size151,936hidden_actsiluattention_biasfalse两个亮点分组查询注意力32 个 Q 头共享 8 个 KV 头显著降低推理时的 KV 缓存占用40K 上下文足以容纳多张高分辨率图 长文档对话。️ 训练管线四步走到最终版本据README.md说明InternVL3.5-4B 依次经历CPT多模态持续预训练文本 多模态语料联合训练配合平方根加权的最下一个词预测损失SFT监督微调32K 上下文引入「思考模式」推理数据MPO离线强化学习DPO BCO LM 三项损失组合——当前仓库模型的直接基座README.md中base_model指向InternVL3_5-4B-MPOGSPO在线强化学习级联强化学习收尾MMMU、MathVista 等推理基准大幅提升。 快速上手最低门槛的部署方式环境要求transformers4.52.1单张 24G 显存 GPU 即可跑起来官方说明 30B 及以下可单卡 A100 部署4B 更轻松import torch from transformers import AutoModel, AutoTokenizer path OpenGVLab/InternVL3_5-4B model AutoModel.from_pretrained( path, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, use_flash_attnTrue, trust_remote_codeTrue, device_mapauto).eval() tokenizer AutoTokenizer.from_pretrained(path, trust_remote_codeTrue) question image\nPlease describe the image shortly. # pixel_values 由动态切图得到完整示例见 README.md 的 load_image response model.chat(tokenizer, pixel_values, question, dict(max_new_tokens1024, do_sampleTrue))要开启「思考模式」只需把系统提示词换成官方 R1 提示并设置do_sampleTrue、temperature0.6。在线服务场景可直接用 vLLM 或 LMDeploy 起 OpenAI 兼容 APIlmdeploy serve api_server OpenGVLab/InternVL3_5-4B --server-port 23333 --tp 1。 关键文件速查文件作用config.json顶层配置 vision_configllm_config三段式结构modeling_intern_vit.pyInternViT 视觉编码器Embeddings / Attention / Encoderconfiguration_intern_vit.pyViT 配置类本模型覆盖为 24 层modeling_internvl_chat.py主模型pixel shuffle、mlp1、chat / generate 逻辑configuration_internvl_chat.py组合式配置把 vision 与 LLM 配置拼装在一起conversation.py对话模板本模型使用internvl2_5模板special_tokens_map.jsonimg、IMG_CONTEXT、box等特殊 tokenchat_template.jinja新版 transformers 的聊天模板 写在最后InternVL3.5-4B 用 4.7B 的体量证明ViT-MLP-LLM 范式简单却高效——InternViT 负责「看」pixel shuffle MLP 负责「压缩」Qwen3-4B 负责「想与说」。动态高分辨率切图让它能看清细节级联强化学习训练让它具备数学与图表推理能力是理解开源多模态大模型架构的绝佳入口。【免费下载链接】InternVL3_5-4B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表