拓冰建站拓冰建站
首页 / 资讯中心 / 正文

实战:多台电脑组AI集群,分布式大模型推理部署完整指南

实战多台电脑组AI集群分布式大模型推理部署完整指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoExo是一个把多台普通电脑连成AI集群的分布式推理开源项目。装在现有设备上多台机器协同跑大模型装不下单机的模型可以拆开分放机器越多生成越快。适合想本地跑大模型、自己掌控集群的开发者和技术爱好者。为什么一台机器不够用本地跑大模型有两个绕不开的瓶颈。第一是内存200B 参数级别的模型光参数加上推理时的缓存就超出一台消费级设备的容量。第二是速度即使勉强塞得下单机算力也是天花板生成速度上不去。顺理成章的做法是多机协作把几台电脑的记忆体拼成一台大机器把模型按层或参数分片放到各台机器上并行处理。难的不是算力本身而是协调——机器之间怎么自动找到彼此、模型该放在哪台机器、机器间通信怎么不拖后腿。这三件事正是 Exo 要解决的。Exo 是怎么工作的一个类比把 Exo 想象成项目组盖楼项目经理先摸清每个工地的人手和材料再决定每一层交给谁干完后统一协调交接。具体到机器内部每个节点跑着几个分工明确的组件。router 负责机器间通信基于 Zenoh 发布/订阅消息用 Rust 实现worker 负责本机的实际工作如下模型、起推理进程master 维护集群状态负责把模型放置到合适的节点election 模块在网络抖动时自动选出新的 master最外层是一个 API 服务把集群能力暴露给外部工具。整个集群采用事件溯源Event Sourcing——一种所有状态变化都记成事件日志、状态由事件回放得出的做法且任一时刻只有一个节点在写事件单台机器故障不会让集群状态混乱。放置逻辑的实现在 src/exo/master/placement.py。三步跑通多机推理 1. 准备环境。macOS 需要 Xcode提供 Metal 工具链再装好 uv、node 和 Rust然后克隆仓库git clone https://gitcode.com/GitHub_Trending/exo8/exo。2. 启动集群。先构建内置仪表盘然后在每台机器上执行uv run exo启动。3. 打开仪表盘。浏览器访问http://localhost:52415/。同一网络内安装了 exo 的设备会自动互相发现不需要手动填 IP 或配置对等关系。选模型、下载、组建实例都在网页上完成。多机到底能快多少 ⚡加速主要来自两处。第一处是 Tensor 并行Tensor Parallelism把模型参数切成分片多台机器同时算同一层的不同部分。官方数据2 台设备最高提速 1.8 倍4 台设备最高 3.2 倍。第二处是 RDMA远程直接内存访问机器之间绕过部分系统环节直接读写对方内存。macOS 26.2 起新增 Thunderbolt 5 上的 RDMA 支持官方给出的数据是设备间延迟降低 99%。第三方作者 Jeff Geerling 在 4 台 M3 Ultra Mac Studio 上做了实测两组数据对比如下Qwen3-235B8-bit单机约 20 tokens/s扩到 4 节点后走 RDMA 的 Exo 达到 31.9 tokens/s而走 TCP 的 llama.cpp 只有 15.2 tokens/s。同样的硬件机器间通信方式不同速度差出一倍多。用同一套方案还能跑更大的模型DeepSeek v3.1 671B8-bit和 Kimi K2 Thinking原生 4-bit都在这组集群上完成推理。进阶配置RDMA 开启与拓扑感知 开启 RDMAmacOS 26.2且设备需支持 Thunderbolt 5关机后长按电源键 10 秒进恢复模式在恢复环境的终端执行rdma_ctl enable重启即可剩下的 exo 自动处理。拓扑感知自动并行Exo 根据实时拓扑视图各设备资源、每条链路的延迟和带宽自动决定模型怎么切、放哪台机器不需要人工规划。集群隔离同一局域网可以跑多个互不干扰的 exo 集群用环境变量EXO_LIBP2P_NAMESPACE区分适合开发集群和生产集群并存。纯协调节点算力不够的机器可以用uv run exo --no-worker加入只做网络与编排不执行推理。监控与运维 打开仪表盘的集群视图就能看到每台节点在跑什么模型、内存占用、温度、功耗以及机器间链路的实时带宽适合挂着长期观察。程序化访问方面每个节点都暴露 HTTP API同时兼容四种格式OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama现有客户端工具换个 base URL 就能接进来。常用操作查模型列表看/models端点查集群状态看/state用/instance/previews预览某个模型的所有合法放置方案再用POST /instance创建实例。类型定义见 src/exo/api/types/api.py完整端点文档在 docs/api.md。适用场景与成本视角 ️家里跑超大参数模型671B 级别的模型单台机器根本装不下4 台 512GB 的 Mac Studio 就能加载 8-bit 版本成本远低于一台同量级的 GPU 服务器。数据不出门的私有推理小团队或个人把敏感数据留在本地集群API 与主流工具兼容存量应用基本零迁移。盘活现有设备闲置的 MacBook、Mac Mini 都能加入集群当节点硬件寿命被延长而不是被丢弃。离线开发与评测配合EXO_OFFLINEtrue离线模式和内置的 bench 工具可以对比不同放置方式下的预填充与生成速度。容易踩的坑 ⚠️RDMA 要求全互联要进 RDMA 集群的每台设备必须和集群内其他所有设备直连且线缆必须支持 Thunderbolt 5。Mac Studio 有口不能用Mac Studio 上紧挨网口的 Thunderbolt 5 口不可用于 RDMA。系统版本必须完全一致包括 beta 版本号都要一致否则 RDMA 口可能互相发现不了。Linux 目前只有 CPU 路径exo 在 Linux 上目前跑 CPUGPU 支持在开发中本文的加速结论主要针对 Apple Silicon 设备。macOS 应用需要系统权限官方 App 需要 macOS 26.2首次运行会请求安装网络配置卸载建议走菜单栏图标 → Advanced → Uninstall能干净移除全部系统组件。写在最后Exo 的价值在于用现有设备就能获得一个可管理的推理集群且兼容主流 API接回存量工具链的成本很低。边界也很明确目前体验最完整的是 Apple Silicon 上的 macOSRDMA 有 Thunderbolt 5、全互联和系统版本一致等前置条件Linux 还在补齐 GPU 支持。如果你手上有两三台闲置的 Mac又想本地跑起大参数模型它值得花十分钟验证一下。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门