十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepSeek-V4-Pro-MXFP4快速上手指南:3个命令在AMD MI350 GPU上跑通本地推理

DeepSeek-V4-Pro-MXFP4快速上手指南:3个命令在AMD MI350 GPU上跑通本地推理 DeepSeek-V4-Pro-MXFP4快速上手指南3个命令在AMD MI350 GPU上跑通本地推理【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4DeepSeek-V4-Pro-MXFP4 是 AMD 官方使用 Quark 量化工具打造的开源模型将 DeepSeek-V4-Pro 的 MoE 专家权重压缩为 OCP MXFP4 格式专为 AMD MI350/MI355gfx950架构优化。本文用3 个命令带你完成 DeepSeek-V4 本地推理部署从克隆仓库到 vLLM 服务启动与精度验证全程约 10 分钟。DeepSeek-V4-Pro-MXFP4 是什么AMD 官方量化版 DeepSeek-V4DeepSeek-V4-Pro 参数量庞大直接部署对显存和带宽要求极高。AMD 团队用 AMD-Quarkv0.12.0仅对所有路由与共享 MoE 专家投影层做 MXFP4 量化而注意力模块、路由门控、归一化层、嵌入层、输出头与 MTP 模块全部保持原精度属于精准瘦身策略。关键信息说明模型架构DeepseekV4ForCausalLMMoE384 个路由专家支持硬件AMD MI355 / MI350gfx950软件栈ROCm 7.2.0 PyTorch 2.9.1 Transformers 5.13.1推理引擎vLLMDocker 镜像rocm/vllm-dev:nightly_main_20260714权重量化OCP MXFP4静态Static激活量化OCP MXFP4动态Dynamic精度表现官方在 GSM8K8-shot基准上BF16 原版得分 94.90MXFP4 量化版 93.6精度恢复率高达99.0%。也就是说牺牲不到 1% 的数学推理精度换来显存占用和推理速度的大幅改善。第一步核对 AMD MI350 推理环境要求开始前请确认以下环境这是 DeepSeek-V4 本地部署成功的前提硬件AMD Instinct MI350 / MI355gfx950 微架构推荐 4 卡起步做张量并行系统Linux 操作系统驱动ROCm 7.2.0 及以上容器Docker rocm/vllm-dev:nightly_main_20260714镜像vLLM 与 lm_eval 均为源码编译安装需export VLLM_ROCM_USE_AITER1开启 AMD 加速内核。 小提示如果你只有单卡可把启动参数里的--tensor-parallel-size改为实际卡数vLLM 会自动做张量并行切分。第二步3 个命令跑通 DeepSeek-V4 本地推理命令 1克隆模型仓库将整个仓库含 64 个 safetensors 权重分片、tokenizer 与配置文件拉取到本地git clone https://gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4仓库根目录的关键文件一目了然config.json 保存模型结构超参61 层、384 专家、1M 上下文窗口generation_config.json 定义采样参数model.safetensors.index.json 则是指向各权重分片的索引。命令 2启动 vLLM 推理服务进入 vLLM 容器后一条命令拉起 OpenAI 兼容的推理服务export VLLM_ROCM_USE_AITER1 export VLLM_ROCM_USE_AITER_FUSION_SHARED_EXPERTS1 vllm serve amd/DeepSeek-V4-Pro-MXFP4 --tensor-parallel-size 4 --kv-cache-dtype fp8 \ --trust-remote-code --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 \ --tool-call-parser deepseek_v4 --enable-auto-tool-choice \ --compilation-config {mode: 3, cudagraph_mode: FULL_DECODE_ONLY}--kv-cache-dtype fp8KV 缓存也用 8 位进一步压显存--reasoning-parser deepseek_v4正确解析think思维链输出--enable-auto-tool-choice开箱支持工具调用Function Calling。命令 3验证推理与精度服务启动后默认端口 30000新开终端用官方同款 lm_eval 跑 GSM8K验证部署正确性lm_eval --model local-completions \ --model_args modelamd/DeepSeek-V4-Pro-MXFP4,base_urlhttp://localhost:30000/v1/completions,tokenized_requestsFalse,num_concurrent32 \ --tasks gsm8k --batch_size auto --num_fewshot 8看到分数稳定在93.6 左右说明你的 AMD MI350 本地推理环境已经完全就绪。✅进阶玩法交互式对话与自定义编码除了 vLLM 服务仓库还附带一套轻量推理实现想深挖原理的同学可以研究inference/generate.py纯 PyTorch 的交互式/批处理推理脚本先通过 inference/convert.py 把 HF 权重转为项目格式再torchrun --nproc-per-node 8 generate.py --ckpt-path ... --config config.json --interactive即可对话encoding/encoding_dsv4.pyDeepSeek-V4 专属的 Prompt 编码参考实现处理多轮对话、思维链thinking、工具调用DSML 格式与快速指令 token配套 encoding/tests/ 下有完整的输入输出测试用例inference/config.json本地推理版配置含 fp4/fp8 专家精度开关与根目录 config.json 略有差异注意区分。常见问题速查问题解决办法启动报 ROCm 版本错误确认rocm-smi版本 ≥ 7.2.0并重拉 nightly vLLM 镜像显存不足OOM降低--tensor-parallel-size或关闭--kv-cache-dtype fp8输出不解析思考内容检查是否带上--reasoning-parser deepseek_v4工具调用失效三个 parser 参数tokenizer / reasoning / tool-call必须同时指定从克隆仓库到跑通推理DeepSeek-V4-Pro-MXFP4 的 AMD MI350 本地部署只需上面 3 个命令。相比原版MXFP4 量化让 MoE 权重占用大幅下降配合 vLLM 的 AITER 内核是当前在 AMD 平台上体验 DeepSeek-V4 的最快路径。现在就去克隆一份试试它的推理速度吧⚡【免费下载链接】DeepSeek-V4-Pro-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/DeepSeek-V4-Pro-MXFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表