
把多台 Mac 拼成一个分布式推理集群exo 如何把大模型拆到多台设备上跑【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个开源的分布式推理项目在局域网里的每台 Mac或 Linux 机器上运行它设备会自动互相发现把一个超大模型分片到多台设备上运行并对外提供一套兼容 OpenAI 格式的 API 和 Web 控制台。这篇文章讲清楚它解决什么问题、原理是什么、怎么跑起来以及上手前需要知道哪些限制。单台机器装不下模型时多机拼集群是一种什么解法在单机上跑 2350 亿参数级别的模型最常见的问题不是速度而是内存不够。常规选择是把请求发到云端 API或者用需要手工配置网络和分片的分布式框架。exo 的做法是把配置成本降到接近零每台机器装好 exo 后直接启动设备会自动发现彼此并组成集群模型按各机器的内存和网络状况被拆到不同设备上集群对外只暴露一个 API 和一个控制台默认http://localhost:52415。官方 README 给出的数据是张量并行Tensor Parallelism即把模型权重按矩阵维度切片到多台设备并行计算下2 台设备约 1.8 倍加速4 台设备约 3.2 倍加速——也就是说加设备不只是装得下更大的模型推理本身也会变快。拓扑感知自动并行exo 怎么决定分片放哪台机器每个 exo 节点同时运行一组组件消息路由Router基于 zenoh 发布订阅协议、负责下载模型和调度推理的 Worker、决定模型放置方案的 Master、网络抖动时重新选举主节点的 Election以及对外 REST API。集群状态用事件溯源管理所有状态变更都记录为事件主节点索引后广播、各节点重放这让节点掉线后状态可以恢复。放置逻辑的核心是拓扑感知自动并行exo 实时观察集群里每台设备的内存以及每两条链路之间的带宽和延迟再据此选出一个最合适的分片方案。你不需要手工指定第几层放哪台机器。放置算法的具体实现可以看 src/exo/master/placement.py。控制台则负责把集群状态可视化哪些节点在线、哪个模型实例正在运行、各节点内存占用如何。下图是 4 台 512GB M3 Ultra Mac Studio 同时运行 DeepSeek v3.18-bit和 Kimi K24-bit时的集群视图从克隆仓库到跑起第一个本地推理集群从源码运行需要 uv、node、RustnightlymacOS 上还需要 Xcode提供编译 MLX 所需的 Metal 工具链git clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo cd dashboard npm install npm run build cd .. uv run exo完成后浏览器访问http://localhost:52415即可在控制台里选模型、直接对话也可以用自己的程序调 API——exo 同时实现了 OpenAI Chat Completions、Claude Messages、OpenAI Responses 和 Ollama 四套接口现有的客户端工具可以直接指向它接口细节见 docs/api.md。macOS 用户也可以直接brew install --cask exo安装后台运行的官方 App免去编译步骤。RDMA over Thunderbolt 需要什么样的硬件普通 TCP 网络下设备间每次传数据都有明显延迟。exo 支持通过 Thunderbolt 5 走 RDMARemote Direct Memory Access允许一台机器直接读写另一台机器的内存绕开大部分内核路径官方称设备间延迟最多降低 99%。这是 macOS 26.2 新增的能力需要在恢复模式的终端里手动执行rdma_ctl enable开启。上图数据来自 Jeff Geerling 的 4×M3 Ultra Mac Studio 集群实测张量并行 RDMA同配置下 DeepSeek v3.1 671B8-bit和 Kimi K2 Thinking4-bit也能稳定运行。但 RDMA 的门槛不低仅限 Thunderbolt 5 机型M4 Pro Mac mini、M4 Max Mac Studio / MacBook Pro、M3 Ultra Mac Studio 等集群内每台设备必须用 TB5 线缆两两直连全网状所有设备的 macOS 版本必须完全一致连 beta 构建号都不能差Mac Studio 上紧挨网口的那个 TB5 口不可用使用 exo 前要知道的局限平台当前状态Apple Silicon MacM3 Ultra / M4 Pro / M4 Max / M5Tier 1 支持GPU 推理Linux目前仅 CPU 推理GPU 支持开发中见 PLATFORMS.mdWindows长期规划中也就是说高性能的现成路径基本只有 Mac 集群这一条。此外还有几点要留意macOS App 要求 macOS 26.2 以上安装时会申请修改系统设置并写入网络配置文件每台节点要有足够内存放下落在自己身上的分片否则放置会直接失败同一网络下有多套 exo 时用EXO_LIBP2P_NAMESPACE或 App 的命名空间功能把集群隔离开避免节点误加入别人的集群如果某台机器只做调度和网络转发、不参与推理可以加--no-worker参数启动。exo 还在快速迭代但多台机器变一个推理集群这条路已经接近零配置装好、开机、设备自己找到彼此。如果你手头有多台 Apple Silicon 设备又想在本地跑大模型可以先从一台单机试起再逐台加入集群。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考