拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek V4 终于“看见”了:首个视觉实验模型开源,真正看点不只是识图

DeepSeek V4 终于“看见”了:首个视觉实验模型开源,真正看点不只是识图

DeepSeek-V4-Flash-Vision-Exp,是 DeepSeek V4 家族的首个视觉实验模型。近日,这款模型率先上线 API;到了 8 月底,模型权重、提示词编码和参考推理实现也一并公开,采用 MIT 许可证。

从名字看,这似乎只是"给 V4-Flash 加上一双眼睛"。但如果仔细看 DeepSeek 公布的能力和案例,就会发现这次更新的重点并不是普通的图片问答。

它更想解决的问题是:当图片、图表、网页和软件界面进入任务后,模型能不能继续推理、调用工具,并把事情做完?

01 不只是看图,而是看完之后继续干活

过去的 DeepSeek-V4-Flash 已经能处理编程、推理和工具调用任务,但它主要生活在文本世界里。遇到网页截图、报错画面、数据图表或者设计稿时,往往需要另一个视觉模型先把图片"翻译"成文字,再交给 Agent 继续处理。

Vision-Exp 把视觉理解直接接进了模型本身。

它支持 JPEG、PNG、GIF 和 WebP,可以描述图片、读取截图中的文字、分析图表,也能同时接收文字和多张图片。于是,一些原本需要多模型配合的任务,就有机会在同一个 Agent 工作流里完成。

比如,它可以先看一张报错截图,再去检查相关代码;也可以读懂一张数据图表,找出异常后继续调用工具分析;还可以对照设计稿修改前端页面,并通过截图检查最终效果。

这正是"视觉模型"和"多模态 Agent"之间的区别。前者回答图里有什么,后者还要理解这张图在整个任务里意味着什么,以及下一步应该做什么。

DeepSeek 在发布页中放出了几个网页生成案例:长篇旅行主题页面、带动画的产品网站,以及包含 3D 元素的交互页面。单看几个演示,当然无法证明模型面对所有前端任务都足够稳定;但它们清楚地展示了 DeepSeek 的方向——视觉能力要进入 Agent 的行动链,而不是停留在聊天框里的"看图说话"。

02 成绩很亮眼,"接近 Opus 4.8"要怎么理解?

DeepSeek 把这次公布的测试分成了两组:文本 Agent 和多模态 Agent。

先看文本能力

Vision-Exp 在 Terminal Bench 2.1 上拿到 83.9,上一版 V4-Flash-0731 是 82.7;NL2Repo 从 54.2 提升到 57.7;DeepSWE 从 54.4 提升到 59.3;Toolathlon-Verified 则从 70.3 提升到 75.9。

并不是每一项都上涨。Cybergym 从 76.7 小幅回落到 75.3,AutomationBench 也只从 25.1 微升至 25.7。整体看,加入视觉模块之后,它至少守住了 V4-Flash 原有的文本、编程和工具使用能力,没有出现明显的顾此失彼。

多模态部分更有意思

在 ApexBench Pass@1 上,Vision-Exp 得到 36.5,Opus 4.8 为 39.4;Chartography 分别是 64.3 和 65.0,两项已经非常接近。在 Agents’ Last Exam 和 ZeroBench 上,Vision-Exp 还分别以 27.3 和 35.0,略高于表中的 Opus 4.8。

  • DATA · 核心增量速览

Terminal Bench 2.1:82.7 → 83.9

NL2Repo:54.2 → 57.7

DeepSWE:54.4 → 59.3

Toolathlon-Verified:70.3 → 75.9

不过,如果把整张表一起看,就不能简单得出"DeepSeek 已经全面追平 Opus 4.8"的结论。

DeepSeek 公布的 11 项测试中,Vision-Exp 在 DeepSWE、Agents’ Last Exam 和 ZeroBench 三项领先,其他多数项目仍然落后。尤其是 NL2Repo,双方是 57.7 对 69.7;DSBench-Hard 则是 63.6 对 71.7,差距依然明显。

还有一个容易被忽略的细节:在 ApexBench 和 Agents’ Last Exam 中,纯文本版 V4-Flash 会直接忽略任务里的多模态信息。所以 Vision-Exp 在这两项上的提升,部分来自"以前看不见、现在看得见",并不是完全对等条件下的能力跃升。

要点:Vision-Exp 已经挤进了前沿多模态 Agent 的竞争区间,但它在真实任务里究竟有多稳,还得等更多开发者把模型跑起来再看。

03 305B 参数,视觉能力是怎么加进去的?

DeepSeek 还没有为 Vision-Exp 模型建立在 DeepSeek-V4-Flash 架构之上,增加了视觉编码器和对齐模块,并经过持续训练。视觉编码器先从图片中提取信息,对齐模块再把视觉特征转换成语言模型能够理解的表示。经过这一步,图片就能和文字、推理过程以及工具调用进入同一条生成链路。

公开权重的统计规模约为 305B 参数。作为参照,此前的纯文本 V4-Flash 为 285B 总参数,每个 token 激活约 13B。Vision-Exp 的具体激活参数量并未单独公布,所以不能直接把纯文本版本的"13B 激活"套到它身上。

它的语言模型部分继续采用 MoE,也就是混合专家架构。模型虽然拥有大量参数,但处理每个 token 时,只会调动一部分专家。公开配置中共有 256 个路由专家,每个 token 选择其中 6 个参与计算。

这也是"Flash"最容易被误解的地方:它说的是计算效率,不是模型很小。

Vision-Exp 还保留了 DFlash 注意力、Hyper-Connections 和 DSpark 推测解码等 V4 架构。简单来说,它们分别服务于长上下文效率、深层网络中的信息传递,以及生成速度。普通用户不需要记住这些名词,只需要知道,DeepSeek 正在尝试用更少的实际计算和缓存开销,驱动一个总体规模依然庞大的模型。

04 100 万上下文,一张图最多 384 个 token

Vision-Exp 支持 100 万 token 上下文,最大输出长度为 384K,并保留思考与非思考模式、工具调用、JSON 输出、Responses API,以及兼容 Anthropic 的接口。

它处理图片的方式也颇为克制。较大的图片会被等比例缩小到大约 800×800 的总像素规模,每张图最多转换成 384 个 token;较小的图片则可能被放大。单次请求最多可以提交 600 张图片,但仍然会受到文件大小和请求体积的限制。

384 个 token 的上限,意味着图片输入不会迅速吞掉上下文,批量处理截图的成本也更低。代价是,极小文字、密集表格和高分辨率细节可能在压缩中丢失。

因此,它很适合常规网页截图、图表和页面设计,但面对复杂工程图、医学影像或者满是小字的超大表格时,仍然需要裁剪、分块和人工复核。支持"原图输入",并不代表模型真的会把原始分辨率里的每一个细节都完整保留下来。

API 端没有为视觉能力额外加价,费用与 V4-Flash 相同。按当前非高峰价格,缓存未命中的输入为每百万 token 0.22 美元,输出为 0.66 美元;图片转换出的 token 和文字一起计费。对于需要批量处理截图、图表或页面的 Agent 应用,这个价格会相当有吸引力。

05 "Flash"很快,但不等于普通电脑随便跑

开放权重之后,开发者可以研究模型,也可以尝试私有部署。但约 305B 的体量,决定了它仍是一款硬件门槛很高的模型。

DeepSeek 给出的 vLLM 方案使用单节点 4 张 GB300,并做四路张量并行;SGLang 示例同样采用 TP=4,同时开启 DSpark。即使部分权重已经使用 FP8、FP4 等低精度格式,完整模型也不是一张消费级显卡能够轻松承载的。

社区量化版本可能继续降低内存要求,一些统一内存设备也有机会把模型加载起来。但"能够启动"和"能够以合理速度、长上下文稳定运行"完全是两回事。特别是把上下文拉到几十万乃至上百万 token 后,缓存和计算压力还会进一步增加。

模型名称最后的 Exp 同样不能忽略。它明确告诉使用者:这是实验版,不是已经经过充分生产验证的稳定版本。推理框架的适配、不同图片类型下的可靠性、长任务中的错误累积,以及视觉输入带来的新安全问题,都还需要时间检验。

06 DeepSeek 补上的,不只是一双眼睛

DeepSeek-V4-Flash-Vision-Exp 的意义,不是让功能列表里多出一个"识图",而是让 DeepSeek 的 Agent 开始走出纯文本环境。

从官方成绩看,它基本保住了 V4-Flash 的文本和编程能力,又把图片、图表与界面接进了工具工作流;在部分多模态 Agent 测试上,它已经接近甚至略高于 Opus 4.8。每张图片最多 384 个 token、百万上下文,以及和 Flash 相同的 API 价格,也让它在批量视觉任务中有了很强的成本吸引力。

与其急着给它贴上"超越谁"的标签,不如把这次开源看成一个信号:DeepSeek 已经把下一阶段的重点放在了多模态 Agent 上。

当模型不再只是读懂文字,而是能够看见界面、理解图表、检查结果并继续操作工具时,所谓 Agent 才真正开始接触现实世界。

Vision-Exp 是 DeepSeek 朝这个方向迈出的第一步。它是不是足够稳、能走多远,还要交给接下来的真实使用来回答。

模型下载

OpenCSG 社区:

https://opencsg.com/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Hugging Face 社区:

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

OpenCSG vs 魔搭:如何选择?

维度OpenCSG/CSGHub魔搭/ModelScope
平台定位企业级 AI 资产管理中心面向开发者和 AI 社区的 MaaS 平台
本地部署一套模型资产管理平台本身偏向模型、SDK 和工具链的本地使用
私有化/离线明确支持私有化部署、离线运行支持下载、本地缓存、本地训练/推理
开源情况平台型产品本身SDK 和大量工具链
项目管理能力模型、数据、代码、应用的统一资产治理,管理模型使用链路模型部署和推理使用

模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。

对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。

关于 OpenCSG

OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态。AgenticOps 是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出,是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

返回列表