
三款热门「Flash」模型对比分析DeepSeek-V4-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash2026 年 8 月下旬三家国产大模型厂商几乎在同一时间窗口放出了各自的「Flash」档位模型。它们都把总参数做大、激活参数做小用稀疏/状态空间注意力把长上下文成本压到接近极限。本文基于官方文档、技术报告与开源权重/推理框架的实测配置对三款模型在参数量、激活量、专业能力、成本、部署要求与实际体验上做一次系统性对比。一 一句话结论模型总参数激活参数定位DeepSeek-V4-Flash284B13B极致性价比的文本/Agent 主力1M 上下文标配GLM-5.3-Flash320B18B首个「稀疏线性」混合注意力的开源多模态模型Qwen3.8-Flash125B6B超稀疏 MoE N-gram EmbeddingQwen4 架构预览三款都不是单纯「小模型」而是大 MoE 的稀疏激活版。激活参数从 6B 到 18B意味着单 token 推理成本都远低于同档稠密模型。二、架构与参数谁把「算力杠杆」用到了极致2.1 总参数与激活参数指标DeepSeek-V4-FlashGLM-5.3-FlashQwen3.8-Flash总参数284B320B125B51B n-gram 4B MTP激活参数13B18B6BMoE 专家256 routed 1 shared288 routed 1 shared512 experts, 10 routed 1 shared层数—4548上下文原生1M1M262K可 YaRN 扩到 1M最大输出384K128K131K推理框架vLLM / SGLangvLLM / SGLang / TokenSpeedvLLM / SGLang / TokenSpeed关键差异在「效率杠杆」Qwen3.8-Flash的 6B 激活参数是三者最低且引入了51B 的 N-gram Embedding用双/三元组索引直接在 embedding 层扩参几乎不增加计算、可 CPU offload。它继承了 Qwen3-Next 的Gated DeltaNet Gated Attention但把 Gated Attention 换成了Qwen Sparse Attention (QSA)——在 micro-block 级别做稀疏选择而不是逐 token 选。此外还有Gated Residual和按权重类别混用 Muon/AdamW 的定制训练配方。GLM-5.3-Flash是业内首个开源前沿模型采用稀疏注意力 线性注意力混合架构线性注意力用状态建模捕获局部依赖稀疏注意力用轻量索引器召回全局上下文。还引入IndexPool把索引器 4 个 KV 向量加权池化成 1 个和Manifold-Constrained Hyper-Connections (mHC)。相比兄弟模型 GLM-5.3注意力计算量降 3.01×、KV 缓存降 4.44×。稀疏注意力是指不再让每个 token 都和序列里所有其他 token 计算 attention而是只保留一部分“重要”的连接。线性注意力是另一类降低 attention 复杂度的方法。它把 softmax attention 改写成线性核函数形式使得Q K T QK^TQKT可以先和 VV相乘从而把复杂度从O ( n 2 ) O(n^2)O(n2)降到O ( n ) O(n)O(n)并能像 RNN / 状态空间模型SSM一样用递推或卷积处理超长序列。DeepSeek-V4-Flash主打Token-wise 压缩 DSADeepSeek Sparse Attention官方宣称 1M 上下文为默认标准且专注 Agent 场景的 Code/工具调用。⚠️版本说明DeepSeek 侧有两个的版本——deepseek-v4-flash模型版本DeepSeek-V4-Flash-0731纯文本/Agent 主力与deepseek-v4-flash-vision-exp多模态实验版2026-08-21 上线。官方明确声明 Vision-Exp 在纯文本能力上与 0731 正式版持平它是给文本基础上加视觉理解的多模态版本而非更强的 0731。因此本横评主体的 DeepSeek 文本/Coding/Agent 数据采用0731 正式版口径仅多模态基准列标注为Vision-Exp 口径。DeepSeek 官方不存在名为deepseek-v4-flash-exp的模型。2.2 谁更「吃显存」三者的 FP8 权重体积直接影响自建部署门槛模型FP8 权重官方推荐部署DeepSeek-V4-Flash~284GB4×H100短上下文/ 4×H2001MGLM-5.3-Flash~306GBvLLM TP4 (GB200) 或 TP8 (H100/H200/MI355X)Qwen3.8-Flash172.78 GiBBF16 为 335 GiBvLLM 4×GB300 / 8×H200TEP8/ 4×MI355XQwen3.8-Flash 的 51B n-gram 表可 offload 到 CPUVLLM_PLE_CPU_OFFLOAD1需 ≥51GB 主机内存这让它在显存受限场景如 4 卡 MI355X、或 262K 上下文比前两者更灵活。三 专业能力Agent / Coding / 多模态 都是抢分点3.1 Coding 与 Agent 能力官方公开的可比基准分数越高越好--表示未披露基准DeepSeek-V4-Flash(-0731)GLM-5.3-FlashQwen3.8-FlashDeepSWE v1.154.463.458.7Terminal Bench 2.182.784.3—NL2Repo54.256.348.1SWE-bench Pro56.0—62.5SWE-bench Multilingual——81.0Toolathlon Verified70.378.473.5Agents’ Last Exam (Pass1)25.226.324.3AutomationBench25.148.8—HLE33.855.3带工具35.9解读GLM-5.3-Flash在 Coding/Agent 类基准上整体领先DeepSWE v1.163.4 vs 46.2和 AutomationBench48.8 vs 26.2相比 GLM-5.2 大幅提升官方称其「接近 Claude Opus 4.8」。Qwen3.8-Flash在SWE-bench Pro / Multilingual这类「真实工程修复」上最强且以 6B 激活打出了接近 13B-18B 激活模型的成绩但 NL2Repo 上略逊。DeepSeek-V4-Flash是三者中「最稳」的 Agent 通用件DeepSWE/NL2Repo/Toolathlon 都处于第一梯队且并发上限最高2500。3.2 多模态视觉 / 视频基准DeepSeek-V4-Flash(-Vision-Exp)GLM-5.3-FlashQwen3.8-FlashChartography (w/ tools)64.378.0—CharXiv Reasoning80.489.484.6AndroidWorld——84.5OSWorld 2.0 (partial)——52.3Vision2Web——64.0MVBench69.477.8—MMVU72.780.5—口径提示此表 DeepSeek 数据来自 Z.aiGLM-5.3-Flash 博客引用的DeepSeek-V4-Vision-Exp。注意各家厂商对 DeepSeek 的具体版本取样有别——Z.ai 用 Vision-ExpQwen 模型卡用DeepSeek-V4-Flash-0731因此 DeepSeek 在「Coding 表」和「多模态表」的数值不可直接同列比较。关键区别DeepSeek的视觉是「后补」的V4-Flash 本体纯文本V4-Flash-Vision-Exp 在 8 月 21 日才上线共享同一套结构参数纯文本能力与正式版持平视觉 Agent 能力接近 Opus-4.8。它的多模态只在 API 侧开源权重本身不带 vision encoder。GLM-5.3-Flash是原生多模态图片/视频/文件视觉直接融入 Coding 循环——能自主「观察」界面、渲染结果与交互反馈并迭代。这也是它的核心卖点。Qwen3.8-Flash同样是原生多模态图/视频在 AndroidWorld/OSWorld/Vision2Web 等「真实使用/复刻」类任务上突出适合 CUAComputer Use场景。四 成本谁能用一分钱买到一分「高级智能」4.1 API 定价对照人民币百万 tokens统一换算成/M缓存命中数据也已收录项目DeepSeek-V4-FlashGLM-5.3-Flash限时5折→原价Qwen3.8-Flash海外输入未命中高峰3.00.8 →0.4—输入未命中闲时1.5——输出高峰9.02.8 →1.4—输出闲时4.5——输入缓存命中0.10高峰/0.05闲时0.23 →0.115$0.016备注峰谷定价工作日高峰打折 50%5 折限时两周$0.15 输入 / $0.47 输出注DeepSeek 采用峰谷定价工作日 9:00-12:00、14:00-18:00 为高峰其余闲时GLM 国内价 5 折限时两周Qwen3.8-Flash 国内走阿里云百炼DASHSCOPE海外 QwenCloud 上$0.15/$0.47。直观结论按人民币折算成美元~7 /USD模型输入峰值输出峰值相对成本DeepSeek-V4-Flash~$0.43~$1.29中GLM-5.3-Flash~$0.11限时/ $0.15海外~$0.20 / $0.50最低Qwen3.8-Flash~$0.15~$0.47低GLM-5.3-Flash 和 Qwen3.8-Flash 在输出侧都做到了 $0.47-0.50/M而 DeepSeek-V4-Flash 输出要 $1.29高峰成本约是前二者的2.5×。4.2 开源 自建成本三者均提供开源权重MIT License 或等同模型生命周期自建门槛DeepSeek-V4-Flash权重已开源HF / ModelScope1M 上下文4×H100 起1M 需 4×H200约 284GB FP8GLM-5.3-Flash权重已开源HuggingFacezai-org/GLM-5.3-FlashMIT约 306GB FP8TP4GB200/TP8H100/H200Qwen3.8-Flash权重已开源HF / ModelScopeQwen3.8-Flash-Next约 180GB4×GB300 / 8×H200 / 4×MI355Xn-gram 可 offload五 实际体验与生态维度DeepSeek-V4-FlashGLM-5.3-FlashQwen3.8-Flash默认思考模式有thinking/non-thinking仅思考thinking only默认思考xhigh/medium/low思考强度控制low/high/max 三档reasoning_effortlow/high/max 近似xhigh/medium/lowAPI 兼容OpenAI Anthropic ResponsesOpenAI智谱风格兼容OpenAI Anthropic Responses工具/Agent 适配Claude Code、OpenCode、CodexZCode/BUA/CUA、大量生态工具Claude Code、Codex并发上限25005015K RPM / 2M TPM强项场景通用 Agent、代码补全、长文档视觉 Coding、Office/金融交付、国产芯片计算机/移动端操控、高并发生产体验层面的几个值得注意的点Qwen3.8-Flash 的preserve_thinking默认保留历史所有思考块牺牲一部分 token 换取 Agent 场景的决策一致性和 KV 复用实测在长程任务上更稳。GLM-5.3-Flash 的思考模式是「强制开启」thinking.type只能enabled不支持关闭官方建议temperature1, top_p0.95, reasoning_effortmax流式同时开streamtool_stream。DeepSeek 的峰谷定价闲时晚上/周末价格砍半适合把批处理任务挪到非高峰的团队能再省一截。并发Qwen3.8-Flash 给到 15K RPM / 2M TPM远超 DeepSeek 的 2500适合高并发在线服务DeepSeek 的 2500 并发更适合大模型 Agent 编排的墙钟调用。七 怎么选你的场景首选需要极致低成本 原生多模态 Coding 闭环GLM-5.3-Flash输出 $0.50/M视觉 Coding 最强国内 5 折更划算需要 6B 激活、超稀疏架构、高并发 API 多模态 CUAQwen3.8-Flash6B 激活、$0.47 输出、15K RPM需要 1M 默认上下文 通用 Agent 稳定 峰谷省钱DeepSeek-V4-Flash1M 标配、并发 2500、闲时半价想彻底自建、避开云依赖三者都开源显存紧选 Qwenn-gram offload要长上下文 1M 选 DeepSeek 或 GLM国产芯片 / 信创环境GLM-5.3-Flash官方已在国产加速芯片集群跑通MI355X 有官方 recipe八 局限与风险提示三家厂商各自的基准都用自家评测框架DeepSeek Harness、Z.ai Code Bench、Qwen 自家 Cowork/RecreationBench不同厂商横评不能直接 pk 分数只能看相对趋势。GLM-5.3-Flash 国内 0.4/1.4 元是限时 5 折两周后恢复 0.8/2.8 元海外 $0.15/$0.50 是稳定价。Qwen3.8-Flash-Next 是「架构预览」版本262K 原生生产接入请用 API 版qwen3.8-flash1M 默认、内置工具。DeepSeek 的deepseek-chat/deepseek-reasoner旧模型名已于 2026-07-24 停止使用需迁移到deepseek-v4-flash。三方都在快速迭代基准数字会随版本变化落地前请核对官方文档。参考资料官方来源首选DeepSeekDeepSeek V4 Preview Release官方公告参数/上下文/开源DeepSeek API 更新日志V4-Flash-0731 / Vision-Exp 上线DeepSeek 模型 价格峰谷定价表DeepSeek-V4-Flash-Vision-Exp 上线公告智谱 GLMGLM-5.3-Flash 官方文档320B/18B、架构、部署GLM-5.3-Flash 技术博客Z.ai 英文原版含基准表智谱模型概览智谱开放平台定价页阿里 QwenQwen3.8-Flash-Next 官方博客Qwen3.8-Flash-Next HF 模型卡架构与基准明细Qwen3.8-Flash API 概览与定价QwenCloud部署与专业延伸vLLM — DeepSeek V4 部署指南vLLM Recipes — GLM-5.3-Flash 部署vLLM Recipes — Qwen3.8-Flash-Next 部署GLM-5.3-Flash 模型权重HuggingFaceDeepSeek-V4-Flash 模型权重HuggingFaceApidog如何在本地运行 DeepSeek V4盈亏平衡分析Spheron在 GPU 云部署 DeepSeek-V4-Flash