exo:多台设备组AI集群,RDMA让大模型跑得更快
exo多台设备组AI集群RDMA让大模型跑得更快【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个开源的本地 AI 集群工具把它装上 MacBook、Mac Studio 甚至 Linux 服务器设备之间自动发现、自动切分模型让单机装不下的超大模型在你的桌面上跑起来。 项目亮点速览4 台 512GB M3 Ultra Mac Studio 同时加载 DeepSeek v3.18-bit与 Kimi K2 Thinking4-bit自动发现零配置组网所有装了 exo 的设备开机即互相发现不用手动填 IP 或开端口加机器就变快支持张量并行2 台设备最高1.8 倍加速4 台最高3.2 倍README 特性数据RDMA over Thunderbolt 5设备间延迟降低99%这是加设备反而更快的关键这些能力背后是几条清晰的代码主线拆开看并不复杂。 架构与核心模块master 协调节点感知设备拓扑、决定模型怎么切分、对外提供 API代码在 src/exo/master/worker 推理节点执行真正的推理苹果设备上由 MLX 引擎 承担支持自动并行切分routing 消息层节点间基于 pub/sub 的事件路由模型下载、推理状态实时同步见 src/exo/routing/内置 Web 仪表盘每台设备都自带管理集群、聊天、看拓扑源码在 dashboard/ 性能实测4 节点集群的数据Qwen3 235B A22B8-bit解码速度对比数据来自仓库内基准测试图测试条件4 台 M3 Ultra Mac Studio 通过 Thunderbolt 5 全互联张量并行4 节点 RDMA解码31.9 t/s同配置走 TCPllama.cpp只有 15.2 t/sexo 约为其 2 倍单节点基线exo RDMA 19.5 t/sllama.cpp TCP 20.4 t/s两者基本打平——节点越多RDMA 优势越大单节点跑平、多节点拉开差距说明这套架构的瓶颈确实压在设备间通信上。快速上手三步跑起你的第一个节点从一台 MacBook 开始即可不必先凑齐集群git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build uv run exo装好uv、node、rust后按上面三行操作浏览器打开http://localhost:52415就能聊天、看集群状态。macOS 用户更省事brew install --cask exo安装菜单栏应用需 macOS 26.2它会在后台常驻并自动处理网络配置。进阶玩法与调优技巧开 RDMAmacOS 26.2 进恢复模式执行rdma_ctl enable设备间用 TB5 线全互联Mac Studio 避开网口旁的 TB5 口这是提速的前提纯协调节点uv run exo --no-worker让配置弱的机器只负责组网和调度不跑推理模型放外置盘设置EXO_MODELS_DIRS/Volumes/ExternalSSD把模型缓存指到大容量 SSD隔离集群设置EXO_LIBP2P_NAMESPACEdev同一网络下多套集群互不串台量化对比分片方案用 bench/exo_bench.py 跑不同 placement 的 prefill/decode 速度挑最优方案适用场景与生态集成单机装不下的大模型671B 级别的 MoE 模型切到 4 台机器上推理本地跑通现有工具直接接入提供 OpenAI Chat Completions、Claude Messages、Ollama 等兼容 APIOpenWebUI 这类前端可以直接指向它接口细节见 docs/api.md评测与调优仓库自带 bench/ 基准与评测脚本换模型、换分片方式都能量化对比写在最后exo 把分布式推理从论文拉回了日常先在一台机器上把uv run exo跑通等第二台设备开机时你会直观看到它被自动发现、模型被重新切分。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考