ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何快速搭建分布式AI集群:exo零配置3步实战指南

如何快速搭建分布式AI集群:exo零配置3步实战指南 如何快速搭建分布式AI集群exo零配置3步实战指南【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo如果你也曾被大模型塞不进单机内存劝退或者正在纠结要不要租云 GPU那么 exo 可以把家里 2~4 台 Apple Silicon 设备变成一台分布式 AI 集群——自动发现、自动并行、无需手动分片而且节点越多推理越快4 节点最高 3.2 倍加速。它帮你省了什么4 个核心优势自动设备发现只要运行 exo设备就在局域网内自动互相发现并组网不用注册 IP、不用配拓扑延迟降低 99%macOS Tahoe 26.2 上通过 Thunderbolt 5 跑 RDMA设备间通信延迟直降 99%拓扑感知自动并行基于设备拓扑与链路带宽的实时视图自动选择最优的模型拆分策略分片决策零操作4 种 API 全兼容OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama现有客户端即插即用内置仪表盘节点状态、集群拓扑、模型启动与聊天一个http://localhost:52415界面全搞定快速上手3 步从零到第一个集群系统要求macOS Tahoe 26.2Apple Silicon需 Xcode 提供 Metal 工具链或 Linux当前为 CPU 运行另需 uv、node、rust 工具链。步骤 1克隆仓库git clone https://gitcode.com/GitHub_Trending/exo8/exo步骤 2构建仪表盘cd exo/dashboard npm install npm run build cd ..步骤 3启动 exo 节点uv run exo看到服务就绪后浏览器打开http://localhost:52415即可看到仪表盘。在另一台设备上重复这 3 步exo 会自动发现彼此并入集群无需任何手动配置。装了 Nix 的 macOS 用户还可以直接用nix run .#exo一条命令跳过构建。核心机制解析它是怎么做到的自动设备发现与集群状态管理每个节点内部运行 master / worker 组件master 负责设备发现、资源汇总与任务调度维护一份实时的集群拓扑清楚知道每台机器的可用内存与负载集群扩缩容时会自动选出主节点。所以无论你在哪台机器上执行 exo加入的都是同一个集群。相关实现可以看 src/exo/master/ 与 src/exo/shared/topology.py。RDMA over Thunderbolt加速的来源普通 TCP 通信每个包都要穿过操作系统网络栈对张量并行这类高频节点间通信是硬伤。exo 用 RDMA 让一台机器直接读写另一台机器的内存延迟降低 99%。这正是加节点反而更快的原因同样的 4 台机器llama.cpp (TCP) 从单节点的 20.4 t/s 掉到 15.2 t/s而 exo (RDMA) 从 19.5 t/s 升到 31.9 t/s。拓扑感知自动并行启动模型时exo 会综合各设备的空闲内存和节点间链路带宽自动计算最优拆分方式张量并行Tensor每一层切到多台机器同时算适合算力密集的负载2 台设备约 1.8 倍、4 台设备约 3.2 倍加速管道并行Pipeline不同层放到不同机器上流水执行适合内存吃紧的超大模型你只需要指定分片策略偏好与最少节点数其余由集群自动决策。效果与数据4×M3 Ultra 上的实测对比下图是 4 台 M3 Ultra Mac Studio 集群上 Qwen3-235B8-bit的推理速度对比关键结论llama.cpp (TCP) 节点越多越慢20.4 → 15.2 t/s而 exo (RDMA) 随节点数从 19.5 t/s 涨到 31.9 t/s4 节点时比单节点提升约 64%——横向扩展的代价不是变慢而是变快这是 exo RDMA 的核心价值。这是 4 台 Mac Studio 集群的仪表盘视图左侧聊天、中央拓扑、右侧实例管理一目了然实战操作启动一个模型实例方式一仪表盘点击式打开http://localhost:52415在右侧 INSTANCE 面板点击 LAUNCH INSTANCE从下拉菜单选择模型也可搜索添加 HuggingFace 上的模型选择分片策略Pipeline 或 Tensor选择通信方式MLX RingTCP或 MLX RDMA设置最少节点数点击启动方式二API 调用预览该模型所有可行拆分方案GET /instance/previews?model_idllama-3.2-1b用选中的拆分参数创建实例POST /instance等待模型加载完成GET /instance/await?model_id...SSE 流返回ready即就绪发送聊天请求curl -N -X POST http://localhost:52415/v1/chat/completions \ -H Content-Type: application/json \ -d {model: mlx-community/Llama-3.2-1B-Instruct-4bit, messages: [{role: user, content: What is AI?}], stream: true}用完后删除实例DELETE /instance/{instance_id}完整端点与参数说明见 API 文档。进阶技巧把性能拉满启用 RDMAmacOS 必做关机 → 长按电源键 10 秒进恢复模式 → 终端执行rdma_ctl enable→ 重启。所有要加入 RDMA 集群的设备必须用 TB5 线缆两两直连Mac Studio 上不能使用以太网口旁边的 TB5 端口且各设备 macOS 版本含 beta 编号必须完全一致模型放外置高速存储EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models uv run exo磁盘满时自动回退默认目录弱设备当纯协调节点内存小但网络好的机器执行uv run exo --no-worker只负责组网调度不参与推理跑分再定方案uv run bench/exo_bench.py --model Llama-3.2-1B-Instruct-4bit --sharding tensor会输出每种拆分的 tokens/s 与峰值内存方便横向对比张量并行与管道并行FAQQ支持哪些系统AmacOS Tahoe 26.2 一等支持M3 Ultra Mac Studio、M4 Pro Mac Mini、M4 Max/M5 MacBook ProGPU 加速Linux 当前 CPU 运行CUDA 支持在路线图中详见 PLATFORMS.md。Q可以混合不同规格的设备吗A可以。拓扑感知自动并行会按每台设备实际的内存与网络能力分配分片配置较弱甚至无 GPU 的机器也能用--no-worker变成纯协调节点。QRDMA 没有提速怎么办A高频原因有三个线缆不是 TB5 规格、设备没有两两直连、各设备 macOS 版本不一致。逐项排查即可。Q如何添加自定义模型APOST /models/add传入 HuggingFace 模型 ID 即可。需要trust_remote_code的模型须显式开启默认出于安全关闭。Q需要特殊网卡或交换机吗A不需要普通局域网即可组网工作但最佳性能推荐 Thunderbolt 5 直连启用 RDMA。写在最后exo 把单机跑不动到几台 Mac 组成集群轻松跑起来的路径压缩到了 3 条命令而 RDMA 带来的横向扩展加速是传统 TCP 方案做不到的。如果你手上正好有 M3 Ultra 或 M4 系列的设备现在就可以试试更多接口细节参考 docs/api.md想参与改进可以看 CONTRIBUTING 指南。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表