十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何在两台 Mac Studio 上运行完整 DeepSeek V4 PRO Q4:DwarfStar 分片实战

如何在两台 Mac Studio 上运行完整 DeepSeek V4 PRO Q4:DwarfStar 分片实战 如何在两台 Mac Studio 上运行完整 DeepSeek V4 PRO Q4DwarfStar 分片实战【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4DwarfStar项目名ds4是一个专为 DeepSeek V4 Flash 与 PRO 打造的本地推理引擎支持 Metal、CUDA 与 ROCm 后端。本文将带你用它的流水线并行分片能力把完整的 DeepSeek V4 PRO Q4 量化模型拆分到两台 Mac Studio 上运行——哪怕单机内存装不下整个模型也能在消费级硬件上跑起来。为什么需要两台机器DeepSeek V4 PRO 是参数量更大的旗舰版本完整 Q4 量化后的 GGUF 文件超出单台 512 GB Mac Studio 的舒适内存范围。DwarfStar 给出的方案很直接把模型按层layer切分每台机器只加载自己负责的那一半通过coordinator协调者与worker工作者角色用普通 TCP 网络把激活值activations在机器间传递对外仍然是熟悉的命令行 / API 体验交互方式不变核心源码位于 ds4_distributed.c 与 ds4_distributed.h配置细节可参考 README.md 中的 Distributed inference 章节。分片原理谁负责哪一层可以把整台推理系统想象成一条流水线coordinator负责分词、采样并计算第 0–30 层worker连接上来负责第 31 层直到输出头31:output每个 worker 还各自保存自己那部分层的 KV 缓存数据在 worker 之间点对点直传不需要协调者中转流量路径为A - B - A这个设计有两个巧妙之处每个进程只映射自己需要的张量内存占用直接减半worker 拥有输出头后可以直接返回 logits省去最后把完整隐藏状态传回协调者的开销⚡ 小知识预填充prefill阶段两台机器可以并行处理不同微批次速度比单机还快但生成decode是严格自回归的每个 token 都要跨机器跑一整圈所以生成速度会比单机略慢。准备模型文件各下载半个模型仓库提供了现成的按层切分的 GGUF 文件在两台机器上分别执行# 协调者机器Mac Studio A ./download_model.sh pro-q4-layers00-30 # 工作者机器Mac Studio B ./download_model.sh pro-q4-layers31-output脚本会下载并保存到本地./gguf/目录支持断点续传机器文件Acoordinatorgguf/DeepSeek-V4-Pro-Q4K-Layers00-30.ggufBworkergguf/DeepSeek-V4-Pro-Q4K-Layers-31-output.gguf下载逻辑可查阅 download_model.sh。注意这两个分片文件不会更新默认的./ds4flash.gguf软链启动时需要用-m显式指定。最小双机配置四行命令跑起来两台机器用雷电 5Thunderbolt 5线直连效果最佳。以直连网口地址169.254.43.68A为例# Mac Studio A协调者负责分词、采样和第 0-30 层 ./ds4 -m gguf/DeepSeek-V4-Pro-Q4K-Layers00-30.gguf \ --role coordinator \ --layers 0:30 \ --listen 169.254.43.68 1234 # Mac Studio B工作者负责第 31 层到输出头 ./ds4 -m gguf/DeepSeek-V4-Pro-Q4K-Layers-31-output.gguf \ --role worker \ --layers 31:output \ --coordinator 169.254.43.68 1234要点提示层区间是闭区间10:20表示第 10 到 20 层N:output表示第 N 层到最后一层加输出头worker 会主动连接协调者并注册自己能算哪些层注册齐了才形成完整路由启动后就像正常使用./ds4一样交互聊天、/read、普通生成都走同一套会话接口实测表现11.47 t/s 是什么体验项目团队在直连192.168.0.182/192.168.0.183的两台 Mac Studio 上做了贪心解码冒烟测试指标数值生成速度11.47 t/s本地层耗时约 39–43 ms/token远端层耗时约 44–49 ms/token单 token 总耗时约 84–92 ms两点预期管理启动较慢每侧都要把半个模型映射并驻留进内存首次加载耐心等待生成速度不算快这是容量型部署目标是跑得起完整 PRO而不是追求高吞吐。11 t/s 对于阅读和审查模型输出完全可用PRO Q2 量化在单台 512 GB Mac Studio 上可达 9.56 t/s见 README.md 的 Speed 表格所以双机 Q4 方案用略高的速度换来了更高的量化精度。网络怎么选雷电 5、以太网还是 WiFi分布式模式底层是纯 TCP任何链路都能工作但延迟直接决定体验。官方在两台 M5 Max 上用同一个 91 GB Flash 量化测得链路平均 Ping预填充生成雷电 50.45 ms582.99 t/s25.09 t/sWiFi77.20 ms250.70 t/s10.70 t/s互联网 / VPN152.10 ms114.88 t/s3.63 t/s强烈建议使用快速以太网或雷电网络。如果只有慢速链路可以试试--dist-activation-bits 16把激活值按 16 位传输减半流量。调优与排障看遥测协调者加--debug会打印每一跳的层范围、本地计算时间、下游等待时间、发送耗时和字节数是判断切分是否均衡的第一工具预填充窗口--dist-prefill-window N控制端到端最多有几个预填充块在途默认 4096 token 的分块--dist-prefill-chunk是经过验证的规范配置worker 掉线协调者会自动把该 worker 移出路由会话恢复后可通过重放 token 历史重建 worker 的 KV 状态无需从头开始会话持久化分布式会话保存的 KV 文件与单机格式完全一致ds4-agent的/save、/switch等机制照常可用写在最后DwarfStar 用极小的工程量演示了一个很有说服力的思路当模型太大、内存不够时把机器粘起来。两台 512 GB 的 Mac Studio靠一根雷电线和一个按层切分的 GGUF就能完整运行 DeepSeek V4 PRO Q4——这在一年前还是只有数据中心才玩得起的规格。如果你想继续探索推荐从以下材料入手分布式配置全貌README.md模型下载目标列表download_model.sh分布式引擎接口ds4_distributed.h基准测试数据speed-bench/注意仓库迭代很快beta 状态协议尚未发布稳定协调者与 worker 请用同一 commit 构建并只在受信任的机器与网络上使用。【免费下载链接】ds4DeepSeek 4 Flash and PRO local inference engine for Metal, CUDA and ROCm项目地址: https://gitcode.com/GitHub_Trending/ds4/ds4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表