拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Exo 分布式AI推理:把家里几台旧设备拼成家庭算力集群

Exo 分布式AI推理把家里几台旧设备拼成家庭算力集群【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo大模型权重动辄数百 GB单台设备内存装不下专业硬件又太贵。Exo 是一个分布式 AI 推理框架把家里的 Mac、Linux 机器等日常设备聚合成一个家庭算力集群让超大模型在本地跑起来而且加设备反而更快。单台设备跑不动大模型的瓶颈在哪多设备跑大模型要同时过两道墙。第一道是内存墙Qwen3-235B 这类模型的权重要占用远超单机内存的容量量化后也未必塞得进一块设备。第二道是算力墙就算装得下推理速度也只能等单芯片慢慢算。绕过的方式不是买更贵的机器而是把多台设备的内存与算力合并成一份资源——这正是家庭 AI 集群的思路闲置的 Mac 和 PC 不再各自为战而是共同承载一个模型。Exo 如何把多台设备拧成一个整体图四台 Mac Studio 通过 Exo 组成的集群拓扑可见每台设备的内存占用、温度与功耗Exo 的机制分三层。第一层是发现所有装了 Exo 的设备会自动发现彼此不需要手工填 IP 或端口。第二层是调度Exo 维护一张实时拓扑视图把每台设备的资源余量和每条链路的延迟、带宽都算进去再决定模型怎么切、放到哪台设备上。它采用张量并行把模型切块后跨设备计算——官方数据是 2 台设备最高提速 1.8 倍、4 台提速 3.2 倍。第三层是传输这是 Exo 与多数同类工具的分野。macOS 26.2 引入了 Thunderbolt 5 上的 RDMA 能力Exo 首批支持设备间通信延迟降低 99%。数据来自 Jeff Geerling 在 4 台 512GB M3 Ultra Mac Studio 上跑的对比同一台集群、同样的 Qwen3-235B (A22B, 8-bit)Exo 走 RDMA对照组是 llama.cpp 走 TCP——1 节点时 19.5 对 20.4 tokens/s2 节点 26.2 对 17.24 节点拉到 31.9 对 15.2。节点越多RDMA 的优势越明显。三步跑起第一个模型第一步准备环境。macOS 需要 Xcode提供 MLX 编译所需的 Metal 工具链另外装好 uv、node、RustnightlyLinux 上 GPU 支持还在开发中目前只能跑 CPU。完整依赖清单见 README.md。第二步克隆并构建。git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build第三步启动。运行uv run exo后本机设备会自动发现并组成集群浏览器打开http://localhost:52415就能看到集群面板。图Exo 内置面板左侧对话区、中间设备拓扑、右侧模型实例与启动参数面板里可以直接搜索并下载模型、选择切分策略Pipeline 或 Tensor、指定最少节点数后启动实例想走纯接口也可以API 的端点和示例请求都写在 docs/api.md。能做什么以及不适合什么️本地助手集群对外提供 OpenAI Chat Completions、Claude Messages、Ollama 等兼容接口现有客户端和工具改个地址就能指向自己的集群。图像生成配合 FLUX、Qwen-Image 等多设备图生模型把扩散模型的负载摊到几台机器上。学习实验平台仓库自带exo-bench可以固定模型后对比不同节点数与切分策略下的预填充和生成速度适合想弄懂分布式推理的人动手验证。边界也要说清楚集群要求设备处于同一网络环境跨设备传输速度受物理链路带宽限制RDMA 需要 Thunderbolt 5 设备并用支持 TB5 的线缆全互联且各机 macOS 版本要完全一致Linux 上目前只能跑 CPU。拿它替代线上高可用推理服务还不现实。Exo 做的事很聚焦把家用设备拼成一个可调用标准 API 的推理集群速度随设备数增长。接口细节见 docs/api.md参与贡献见 CONTRIBUTING.md。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门