十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说 一句话总结DeepSeek V4-Pro 旗舰模型今天正式 GAAgent 能力据报暴涨DeepSWE 从 12.8 飙到 62.7价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的还没有任何第三方验证过。便宜是真的强不强得再等等。导语你的 API 账单还好吗如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人最近几个月大概率有过一个念头“这 API 账单能不能便宜点”Anthropic 的 Fable 5 输出 token 要 $50 每百万——跑一轮复杂的 agent 工作流几十刀就没了。GPT-5.6 Luna 刚降了价输入 $0.2/M 输出 $1.2/M已经很有诚意了。但 DeepSeek V4-Flash 的 $0.14/$0.28 直接把地板价又踩穿了一层。然后今天8 月 12-13 日DeepSeek 的旗舰模型 V4-Pro 也正式转正了——版本号 0813从预览版变成了 GAGeneral Availability。号称 Agent 能力暴涨号称追平甚至部分超越 Claude Fable 5号称只要 Fable 5 的 1/46 价格。听起来是不是太好了所以这篇就帮你看懂什么是真的、什么有水分、什么完全还没验证。想自己动手试 官方定价页DeepSeek API Pricing 多供应商入口OpenRouter — DeepSeek V4 Pro KOL 快评Simon Willison — V4 Pro 0813 详细验证报告The Cherry Creek News — 0813 GA 分析 今天到底发生了什么一句话DeepSeek V4-Pro 从预览版转正成正式版了。具体说DeepSeek 在自己的 API 定价页上把deepseek-v4-pro端点的版本号更新成了DeepSeek-V4-Pro-0813。OpenRouter 也同步上线描述里白纸黑字写着 “This is the GA release of DeepSeek V4 Pro”。同时DeepSeek Chat 网页版和客户端也用上了这个版本——普通用户打开就能免费用到DeepSeek 至今没有消费级付费订阅chat 是完全免费的。模型本身没有架构变化仍然是 MoE混合专家架构简单说就是总参数巨大但每次推理只激活一小部分专家上场1.6 万亿总参数、490 亿激活100 万 token 上下文窗口最大输出 38.4 万 token。MIT 开源许可。这些都和 4 月 24 日预览版发布时一致。变的是后训练和 Agent 能力。DeepSeek 自己发布了一组对比图表——把 0813 和 4 月的预览版做了基准对比基准预览版0813 GA涨幅Terminal-Bench 2.172.187.915.8CyberGym52.783.330.6DeepSWE12.862.749.9AutomationBench12.831.819.0DSBench-Hard31.167.236.1DeepSWE 从 12.8 涨到 62.7——接近 50 个百分点的跳升这种增幅在 AI 基准里几乎闻所未闻。但请先记住这个数字后面会说到它的来源问题。有意思的是这次 GA 还有一个家务事的背景。7 月 31 日 DeepSeek 把更便宜的 V4-Flash 先转正了公测版结果 Flash 在 9 项 Agent 基准上反超了自己的旗舰大哥 Pro 预览版。旗舰模型被自家小弟打脸两周后 V4-Pro-0813 就带着暴涨的 Agent 跑分来了——核心叙事就是旗舰夺回了 Agent 王座。DeepSeek 官方没这么说过但这个时间线和数据走向你品。 便宜到什么程度先把那个1/57的口号掰扯清楚网上流传一个说法“V4-Pro 是 Fable 5 价格的 1/57”。这个数字有没有道理有但它是被高度压缩过的。kingy.ai 做了个事实核查结论是这样的输出 token 单独算V4-Pro $0.87/M vs Fable 5 $50/M确实是大约 1/57输入 token 单独算V4-Pro $0.435/M vs Fable 5 $10/M大约是 1/23混合负载实际算输入输出综合大约1/46所以异常便宜这个定性判断完全成立——但1/57把三个不同口径的数字压缩成了一个严格来说是误导。更准确的说法是“大约 1/46”。给你一个更直观的参照模型输入 $/M输出 $/M备注DeepSeek V4-Pro$0.435$0.87永久价原价 $1.74/$3.48DeepSeek V4-Flash$0.14$0.28比 Pro 还便宜 3 倍GPT-5.6 Luna$0.2$1.2刚降过价Claude Fable 5$10$50前沿旗舰Kimi K3$3$15中国同梯竞品5 月 22 日DeepSeek 把 V4-Pro 的 75% 促销折扣变成了永久价——不是限时活动了是长期 list price。这意味着你可以放心签 12 个月的企业合同了不用担心下个月价格弹回去。但是总是有但是的DeepSeek 定价页上同时挂了一条声明——“计划在近期上调整体 API 定价预计会有显著增长”。具体涨多少、什么时候涨都没说。所以当前这个价格更像是窗口期价格而不是永久承诺。 Agent 跑分暴涨先看看数据是怎么来的回到那个 DeepSWE 从 12.8 飙到 62.7 的数字。这个增幅大不大大得离谱。能不能信目前只能信一半——“数字确实是 DeepSeek 发的”但有没有那么强还没有任何人独立验证过。几个事实帮你判断这些数据的质量来源是 DeepSeek 自己的对比图表通过官方 WeChat 群和 X 账号发布被博客转载传播。Reddit 上有人搬运被版主以低质量为由删除了benchable.ai 上该模型的页面是空的——第三方基准平台还没有任何结果DeepSeek 官方 changelog 没有 GA 发布的条目——最后一次更新还停在 7 月 31 日 Flash 公测的公告0813 的开源权重还没发布——HuggingFace 上仍然托管的是 4 月预览权重月下载超 140 万次的也是那个旧版本对比基线是自家预览版不是竞品——也就是说涨了 50 个百分点的参照物是自己的旧版本不是 Fable 5 或 GPT-5.6更值得注意的一个细节那组 Agent 图表用的是 Terminal-Bench2.1而 4 月预览版发布时的标准基准表用的是 Terminal-Bench2.0——不同版本分数不可直接比较。所以你看到预览版 Terminal-Bench 67.9和0813 Terminal-Bench 87.9时别急着算差值它们用的可能不是同一套卷子。Simon Willison知名 AI 博主在他的博客里提到一个耐人寻味的细节他测试时发现 V4-Pro 在不同推理强度low/medium/high下生成的图片差异极大——“没有其他模型有这种程度的差异”。这意味着推理强度对输出质量的影响可能比其他模型显著得多选对档位很重要。总结一下数据可信度DeepSeek 自己的标准基准4 月发布的 SWE-Bench、LiveCodeBench 等已经被多个第三方验证过大体靠谱。但 0813 的 Agent 大幅提升数据目前完全是孤证——只有 DeepSeek 一家在说没有任何人复现。‍ 开发者社区怎么说Hacker News 是这次讨论的主战场。V4 系列今年 4 月首发的主帖拿到了 2091 分和 1607 条评论——HN 近期最热的 AI 话题之一。社区反馈大致是6 成正面、3 成谨慎、1 成负面。说好的那拨人主要激动于成本“在 max reasoning 设置下我的 credit 余额几乎不动”——这是真实 API 用户反馈有人估算加上 agentic 工作流中典型的缓存命中率实际花费比 Claude Opus 便宜约 60 倍DeepClaude 项目把 V4-Pro 塞进 Claude Code 的 agent loop 里跑在 HN 拿了 678 分说明用 DeepSeek 引擎跑 Claude Code的需求真实存在LiveCodeBench 93.5 分是同表所有模型最高Codeforces rating 3206 也压过 GPT-5.4 的 3168说不好的那拨人给了一个特别有杀伤力的真实对比“Deepseek 4 pro跑了 12 分 02 秒花了 $0.12——有 bug。Grok 4.6跑了 3 分 18 秒花了 $1.41——没 bug。”十二美分跑出来一个带 bug 的结果和一块四跑出来一个干净的结果——这个对比精准地命中了便宜 ≠ 好的痛点。当然正如另一位 HN 用户说的“这是非确定性系统单次试验不能大幅更新你的先验。” 一个样本说明不了什么但至少提醒我们跑分和实际使用体验之间可以有巨大鸿沟。还有几个反复被提到的关切隐私政策“DeepSeek 的隐私政策异常糟糕——他们可以用你的 prompt 和补全做训练。” 对企业级敏感数据来说这是一条硬伤推理速度高负载时段明显变慢。DeepSeek 的计算资源只有约 2 万张 H100在高并发下推理会慢到爬行基准方法论质疑有人指出harness测试框架的权重几乎和模型本身一样大意思是你换个测试工具链可能分数完全不一样 几个你该知道的信号在你考虑要不要切到 V4-Pro 之前有几个信号值得放在心上第一DeepSeek 7 月的 token 消耗量已经仅次于 Anthropic8 月大概率登顶。这意味着它正在获取全球最大规模的用户交互数据——这些数据直接喂给后训练可能形成用户越多→数据越多→模型越强→用户更多的飞轮。从行业竞争角度看这是一个值得关注的结构性优势。第二V4-Flash 可能是更务实的选择。Flash 只要 $0.14/$0.28 每百万 token比 Pro 还便宜 3 倍而且 Terminal-Bench 2.1 已经到了 82.7——和 Pro 的 87.9 差距不大。如果你的工作负载是日常编码、分类、摘要、RAG 检索Flash 的性价比可能比 Pro 更高。Pro 真正的价值在于最难的 agentic 长链任务那种需要几百步工具调用的场景。第三0813 的开源权重还没出来。如果你是要自托管的研究者或企业现在能用的还是 4 月的预览权重。DeepSeek 没说什么时候发 0813 权重也没说 GA 版和预览版在模型本体上是否有区别——可能只是后训练不同也可能是全新 checkpoint。第四今天是三连发的一天。除了 V4-Pro GAGrok 4.6 也发布了Intelligence Index 61只有 GPT-5.6 Sol 价格的五分之一阿里也上线了第一个开源 Qwen-Max。三家公司同日发旗舰——AI 模型的迭代节奏已经从季度旗舰加速到月度旗舰了。这对消费者是好事但也意味着你现在选的模型下个月可能就不再是性价比最优了。把话说明白回到开头那个问题“这 API 账单能不能便宜点”答案是能而且便宜得超出预期。V4-Pro 的定价在当前市场上确实是碾压级的——同等质量的工作负载花不到 Fable 5 的零头这不是营销话术是定价页上白纸黑字的数字。Reuters 引用研究机构的结论也说DeepSeek 是知名模型中运行成本最低的。但便宜和好用之间还有一段路。Agent 能力暴涨的数据目前只有 DeepSeek 自己在说benchable.ai 空空如也社区实测也有十二美分跑出 bug的案例。V4-Pro 在编程基准上的实力LiveCodeBench 全场最高、Codeforces 领先 GPT-5.4是多方验证过的但 0813 新增的 Agent 提升是否如报所述还需要时间检验。一个务实的做法先用起来用你自己的真实工作负载测别只看跑分表。DeepSeek Chat 是免费的API 成本低到你可以在 max reasoning 下跑几十轮都不心疼。如果在你自己的任务上 V4-Pro 的表现够用——那这个价格就是真的香。如果在你的场景下频繁出 bug 或者速度慢到影响效率——那再便宜也不值。毕竟AI 模型是非确定性系统。你的场景、你的 prompt、你的任务复杂度才是最终的决定因素。跑分表只是参考——而参考的价值取决于参考本身站不站得住。参考来源DeepSeek API 定价页一手/官方— https://api-docs.deepseek.com/quick_start/pricingOpenRouter DeepSeek V4 Pro 模型页一手/平台— https://openrouter.ai/deepseek/deepseek-v4-proUnite.AI — DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview垂直媒体— https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/Wccftech — V4-Pro-0813 定价与 token 消耗分析垂直媒体— https://wccftech.com/deepseek-prices-its-new-v4-pro-0813-model-at-0-87-per-1-million-output-tokens-as-the-high-flying-chinese-ai-lab-wows-with-its-soaring-token-consumption/Simon Willison’s Weblog — V4 Pro 0813 快评社区/KOL— https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/The Cherry Creek News — 0813 GA 详细验证报告垂直/分析— https://thecherrycreeknews.com/deepseek-v4-pro-0813-ga-pricing-benchmarks-analysis-cherry_creek/DeepSeek Benchmarks 2026 — 标准基准全表垂直/分析— https://deepseekai.guide/news/deepseek-benchmarks-2026/Hacker News V4 主帖社区— https://news.ycombinator.com/item?id47884971作者lusca版本lusca-report-blog v1.0.0出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog
返回列表