十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南

4台家用Mac能跑671B大模型?exo多设备AI集群本地部署完整指南 4台家用Mac能跑671B大模型exo多设备AI集群本地部署完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo家里那台内存不够的大模型跑不起来别急着买显卡exo 是一个把你所有设备连成 AI 集群的开源框架装完自动组网、自动分片让大模型跑到单台设备根本装不下的大模型上。读完这篇你能拿到✅ 120 个模型卡的真实支持清单附硬件门槛✅ 从 clone 到跑通的最小 6 步路径✅ RDMA 组网、量化、离线模式等 5 条直接能用的调优建议一句话看懂 exo把闲置设备拼成你的本地推理集群exo 的核心机制就一句话每台设备各装一份 exo它们自动互相发现然后把模型按拓扑智能切分——哪台内存大就多放点哪台连得近就少传数据。它的默认推理后端是苹果的 MLX所以 Mac 是最佳搭档Linux 也能跑只是目前走 CPU。官方展示效果4 × 512GB M3 Ultra Mac Studio 同时跑 DeepSeek v3.18-bit和 Kimi-K2-Thinking4-bit集群视图就长这样。能跑哪些模型120 模型卡清单和硬件门槛exo 用 TOML「模型卡」描述每个模型层数、显存占用、是否支持张量并行内置的推理模型卡都在 resources/inference_model_cards/ 目录里目前 123 个。挑几个有代表性的类别代表模型模型卡路径硬件门槛典型用途超大 MoE LLMDeepSeek-V3.1671B8bitmlx-community--DeepSeek-V3.1-8bit.toml约 712GB需 4×512GB Mac超长上下文推理超大 MoE LLMQwen3-235B-A22B8bitmlx-community--Qwen3-235B-A22B-Instruct-2507-8bit.toml数百 GB建议 4 台 Mac智能对话、Agent旗舰思考模型Kimi-K2-Thinking4bitmlx-community--Kimi-K2-Thinking.toml多台设备分摊深度思考、代码70B 级 LLMLlama-3.3-70B-Instruct4bitmlx-community--Llama-3.3-70B-Instruct-4bit.toml约 40GB2 台 32GB 设备即可日常对话、写作单台可跑 LLMQwen3-30B-A3B4bitmlx-community--Qwen3-30B-A3B-4bit.toml16~32GB 单台 Mac轻量问答视觉多模态Qwen3-VL-4B-Instruct4bitmlx-community--Qwen3-VL-4B-Instruct-4bit.toml单台 16GB 即可图文理解图像生成FLUX.1-dev / Qwen-Imageresources/image_model_cards/需开启EXO_ENABLE_IMAGE_MODELS文生图、图生图除了内置清单你还能从 HuggingFace 拉任意 mlx 格式模型exo 会自动读 config.json 生成模型卡逻辑在 src/exo/shared/models/model_cards.py。重点拆解三个决定体验的功能自动发现与拓扑感知分片模型怎么被切到多台设备这是 exo 最核心的「大脑」。启动后设备自动互相发现无需手动配 IP随后 master 节点根据实时拓扑各设备剩余内存 每根链路的延迟/带宽算出最优切分方案实现入口在 src/exo/master/placement.py。你不用指定哪台放哪层/instance/previews接口会列出所有合法摆放方案让你挑内存不均也没关系它按「实时视图」分配大内存设备自动多扛常见坑设备时间/OS 版本不一致时可能发现失败RDMA 集群尤其要求系统版本完全一致张量并行 雷电 RDMA加机器反而更快传统管线切分加机器只是「装得下」exo 支持张量并行Tensor Parallelism2 台设备提速约 1.8 倍、4 台约 3.2 倍而且 macOS 26.2 起支持 Thunderbolt 5 上的 RDMA设备间延迟降低 99%。实测截图来自 Jeff Geerling 的评测Qwen3-235B8-bit在 4 × M3 Ultra Mac Studio 上跑张量并行 RDMA。支持设备M4 Pro Mac Mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio开机前长按电源进恢复模式终端执行rdma_ctl enable再重启即可坑点设备间必须用 TB5 线全互联Mac Studio 上以太网口旁边那个 TB5 口不可用四种主流 API 全兼容你现有的工具直接能用exo 的 API 同时实现了OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama四种格式接口都在http://localhost:52415。也就是说 ChatGPT 客户端、Claude 客户端、OpenWebUI 这类现成工具把 base URL 指过去就能用一行代码不用改。端点细节见 docs/api.md。从零到跑通6 步搭起你的第一个多设备 AI 集群装环境git clone https://gitcode.com/GitHub_Trending/exo8/exomacOS 上建议装好 Xcode 后用 brew 装uv、noderust 用 rustup 装 nightly装了 Nix 的话nix run .#exo一条命令跳过大部分步骤构仪表盘cd dashboard npm install npm run build启动节点每台设备都跑uv run exoAPI 和仪表盘起在http://localhost:52415自动组网同一网络内的节点互相发现无需手动配置懒人直接brew install --cask exo装 macOS 菜单栏版选模型仪表盘里搜索可搜 HuggingFace点选后按推荐的摆放方案创建实例等它返回 ready开始用网页里直接聊或用 curl 打/v1/chat/completions格式和 OpenAI 完全一样性能调优普通用户马上能做的 5 件事全互联 开 RDMA → 加机器真的变快TB5 线把所有设备两两连上并启用 RDMA张量并行才能在 4 台设备上拿到 3.2 倍提速否则只能退化为普通组网优先选 4bit 量化版本 → 省一半内存同一模型 8bit 和 4bit 的模型卡通常并存设备内存吃紧时直接换 4bitDeepSeek 671B 从 712GB 直接砍半把模型盘指到外接 SSD → 下载和加载都快设EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models默认盘满了会自动落到第一个空间够的目录低配机器用--no-worker加入 → 没显卡也能入伙只跑协调和组网不跑推理让家里老设备当「指挥员」用 exo-bench 跑一轮基准 → 数据说话uv run bench/exo_bench.py --model 模型 --pp 128,512 --tg 128对比不同摆放的 prompt/生成 tps 和峰值内存工具在 bench/exo_bench.py 离线环境记得EXO_OFFLINEtrue只加载本地已下载模型避免每次启动去访问 HuggingFace。写在最后exo 把「多设备跑大模型」从折腾组网、手动切分的事变成了装完即用的事自动发现、自动分片、兼容你手里所有 API 客户端。家里几台 Mac 凑一凑671B 级模型也不是只能仰望的玩具。下一篇我们聊聊「只用 2 台 32GB 的 MacBook怎么跑满 70B 模型还不发烫」想看的先点个收藏。 收藏本文备用关注 exo 仓库获取模型卡更新和 RDMA 支持进展——新模型支持基本是 day-0 跟进的。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表