十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从零10分钟把家用设备跑成一个AI集群

从零10分钟把家用设备跑成一个AI集群 从零10分钟把家用设备跑成一个AI集群【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo办公室的 Mac 合着盖桌面上那台 64GB 内存的机器整夜闲置而你想跑的大模型单机根本装不下。Exo 干的事情很直接把同一局域网里的多台设备组成一个 AI 集群把模型权重拆开分到几台机器上同时对外提供一个 API 和一块管理面板。三步启动Exo集群1. 克隆仓库并构建面板。依赖方面macOS 上需要 Xcode、brew、uv、node、rustLinux 上装 uv、node 18 和 rust 即可装法可参考 README这里不展开。git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build2. 启动一个节点。每台要入网的机器上都执行同一命令uv run exo3. 打开面板。浏览器访问http://localhost:52415/每台节点都提供这个面板和 API。同网段的其他节点会自动被发现不需要手动录入 IP 或端口谁开着 exo 谁就在网里。设备探测与权重切分是怎么配合的整个决策链是输入 → 处理 → 输出输入每台节点启动后上报自己的可用内存、芯片型号和网络链路类型Wi-Fi、以太网还是雷雳/RDMA采集逻辑在 设备信息模块。处理master 节点把这些数字建成一张拓扑图见 拓扑图代码随后 放置策略代码 在其中找环状路径按可用内存占比给每台机器分模型层数——内存大的多扛层内存小的少扛层芯片算力TFLOPS每秒万亿次浮点运算数值越高算力越强也参与评估。输出一份具体的切分方案哪层权重落在哪台机器上面板上可以直接看到不满意可以换一个放置方案重建实例。关键参数作用可用内存占比决定这台机器分到多少层权重链路类型Wi-Fi/TB5/RDMA决定机器之间传数据的速度环状路径数据在节点间流动的顺序张量并行单层权重拆到多机并行计算加机器能提速常见调优场景节点、面板与分区同网段跑了两套集群互相串。用命名空间隔离开发集群和生产集群各设一个EXO_LIBP2P_NAMESPACEdev-cluster uv run exo磁盘装不下模型文件。默认存在本地模型目录可以用EXO_MODELS_DIRS把下载目录指到移动硬盘或设EXO_MODELS_READ_ONLY_DIRS指向 NFS 等已下好的共享存储省得每台机器各下一份。节点掉线了不知道原因。请求/state看当前拓扑和实例/events看 master 记录的内部事件日志在~/.cache/exo/Linux下自带轮转。某台机器只当调度员不当苦力。网络好但没有空闲内存的机器用--no-worker只跑协调组件不执行推理。想量化不同切分方式的差距。仓库自带 基准测试脚本可以对比 pipeline 和 tensor 两种切分下的 token 吞吐与峰值内存。适合谁以及它做不到什么适用场景多台 Apple Silicon 设备想跑超过单机内存的模型README 里 4 台 M3 Ultra 跑过 671B现有工具想接一个 OpenAI/Claude/Ollama 兼容格式的本地端点研究切分策略用 exo-bench 验证加机器是否真的更快。已知限制GPU 加速目前只覆盖 macOSApple SiliconLinux 上是纯 CPU 跑速度别抱太高期望RDMA over Thunderbolt 5 要求 TB5 硬件、macOS 26.2且所有节点系统版本必须完全一致机器间还需全互联Wi-Fi 组网则受带宽制约大模型切分后通信开销会比较明显。一句话讲完Exo 把家里几台设备当成一台电脑用原来装不下的模型现在装得下。克隆仓库十分钟跑起来试试顺手去仓库 Star 一下。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表