十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

4台Mac组成本地AI集群跑671B大模型:exo分布式推理上手指南

4台Mac组成本地AI集群跑671B大模型:exo分布式推理上手指南 4台Mac组成本地AI集群跑671B大模型exo分布式推理上手指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo单台设备塞不下的大模型怎么跑起来exo 把同一网络里的多台设备自动发现、组成分布式集群用 Thunderbolt 5 上的 RDMA 互联做张量并行切分模型加机器还能继续提速。读完本文你能在自家设备上跑起本地大模型并看懂调度器怎么切分模型。最小运行配置3条命令跑起来git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build cd .. uv run exo浏览器打开http://localhost:52415在面板里选一个模型、点加载就能开始聊天。关键点在于每台装了 exo 的机器Mac 上可用brew install --cask exo安装菜单栏 App都会自动发现同网络里其他节点不需要任何手动配对配置。模型加载完成后集群同时提供 OpenAI Chat Completions、Claude Messages、Ollama 三种兼容 API你现有的客户端和工具不用改代码就能接进来。模型怎么切到多台机器上环形拓扑与张量并行exo 的调度逻辑在 src/exo/master/placement.py 和 src/exo/shared/topology.py核心流程四步建图节点间通过本地网络互相发现每台机器上报自己的内存、芯片和互联方式组成一张实时拓扑图——节点是设备边是连接含延迟和带宽。筛选环调度器在图里找环所有节点互联成闭环的拓扑只保留总空闲内存装得下模型权重的环。排约束要求张量并行tensor parallelism把模型权重按层拆到多台机器同时计算而不是像流水线那样逐段交接的模型节点数必须能整除其 hidden size 和 KV 头数在满足条件的环里优先选最小环且优先选全部启用 RDMARemote Direct Memory Access让一台机器直接读写另一台内存、跳过操作系统网络栈的传输方式的环。切分与启动按分配结果在各节点落权重、拉起实例面板上随即出现集群视图。上图是四台 512GB M3 Ultra Mac Studio 的集群面板同一集群并行加载了 8-bit 的 DeepSeek v3.1 和 4-bit 的 Kimi K2 Thinking 两个大模型。一个类比调度器选环像选快递中转站——先要求所有站点互相有直达路线成环再挑站点最少但仓位够大的那组。而 RDMA 的区别在于普通网络传数据像用卡车装卸货RDMA 像站点之间开了传送带这就是官方宣称节点间延迟降低 99% 的来源。⚠️RDMA 配置有三个硬门槛只支持 Thunderbolt 5 的机型M4 Pro/Max、M3 Ultra且需要 macOS 26.2Mac Studio 上以太网口旁边那个 TB5 口不能用于 RDMA所有节点必须手拉手全互联且 macOS 版本号要完全一致连 beta 号都要相同。不满足任一条会静默回退到普通网络提速效果直接消失。从单机到4机的性能对比为什么加机器更快下面是仓库收录的实测数据Jeff Geerling 在 4 × M3 Ultra Mac Studio 上的测试Qwen3-235B-A22B 8-bit 为例单位 tokens/s节点数llama.cppTCPexoRDMA单机20.419.52 机17.226.24 机15.231.9注意两条曲线方向相反TCP 方案节点越多同步开销越大吞吐从 20.4 掉到 15.2exo 走 RDMA 则从 19.5 一路升到 31.94 机相比单机约 3.2 倍官方给出的张量并行上限是 2 机 1.8 倍、4 机 3.2 倍。同组测试里 DeepSeek v3.1 671B 8-bit 4 机达到 32.5 t/sKimi K2 Thinking 4 机 28.3 t/s。要清醒看待这些数字的适用边界Linux 上 exo 目前只跑 CPUGPU 支持还在开发中没有 TB5 的老机型只能走流水线并行pipeline parallelism按层顺序把模型分到不同机器上一段算完才交接下一段扩展效率远低于张量并行仓库的单机基准测试本身要求 Mac 内存至少 96GiB小内存设备能跑的模型规模有限。容易踩的坑⚠️RDMA 手动开启步骤关机 → 长按电源键 10 秒进恢复模式 → 终端执行rdma_ctl enable→ 重启。跑源码的话还需执行仓库里的tmp/set_rdma_network_config.sh关闭 Thunderbolt Bridge 并为每个 RDMA 口配置 DHCP跳过这步端口互相发现不了。⚠️同网络多集群串扰同一个网段里跑多套 exo比如开发集群和生产集群节点会互相发现、混成一个大集群。用环境变量EXO_LIBP2P_NAMESPACE给集群起独立命名空间即可隔离。常见疑问Linux 能用吗能跑但只有 CPU 推理速度不适合大模型GPU 支持在开发中建议 Linux 用户先观望或用--no-worker把 Linux 机器当纯协调节点。断网/离线怎么跑设EXO_OFFLINEtrue启动只使用本地已下载模型也可以把预下载模型放在 NFS 上用EXO_MODELS_READ_ONLY_DIRS指定只读目录省得每台机器重复下载。怎么加 HuggingFace 上的自定义模型调一次 APIPOST http://localhost:52415/models/addbody 里带model_id: mlx-community/你的模型需要远程代码的模型默认被安全开关拦住要显式开启。写在最后exo 目前的定位很明确Apple 生态优先的本地大模型集群Linux GPU 支持还在路上。但从自动发现到拓扑感知切分、从多 API 兼容到内置面板的链路已经完整加一台设备、多一分吞吐这件事在 Thunderbolt 5 的 RDMA 上第一次有了可靠的兑现方式。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表