
Exo 本地 AI 集群指南3 步把多台 Mac 聚成大模型算力【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo单台 Mac 的内存装不下 671B 的模型Exo 是一个分布式推理项目它把多台设备的内存合并成一块可共享的容量池让本地大模型跑得动。读完这篇指南你会了解它的组网方式和硬件门槛并能用 3 步在自己机器上跑起第一个模型实例。一台设备装不下大模型先看多机拼算力的场景你手头是一台 32GB 内存的 Mac Studio想跑 Qwen 或 DeepSeek 级别的大模型单机装不下另购专业服务器又超出预算。Exo 的做法是把手头的设备串起来4 台 512GB 的 M3 Ultra Mac Studio 通过雷电 5 互联后可以在同一控制台里加载 DeepSeek v3.18-bit和 Kimi-K2-Thinking4-bit这类超大模型并统一管理推理任务。图Exo 仪表盘集群视图4 台 M3 Ultra Mac Studio 正在运行 DeepSeek v3.1 与 Kimi-K2-Thinking Exo 分布式推理的三个机制设备自动发现安装 Exo 的设备会自动发现同网内的其他节点不需要手工填写地址或端口。你只需把设备接入网络组网由 Exo 自己完成。拓扑感知的模型切分Exo 实时读取每台设备的内存、算力与链路延迟、带宽据此决定模型如何切分、放在哪台设备。部署方案由它自动计算你无需手动规划。雷电 5 上的 RDMA 加速在支持的设备上设备间通信延迟最高可降低 99%。张量并行让 2 台设备提速约 1.8 倍、4 台提速约 3.2 倍加设备不仅是扩容还能提速。图4 台 M3 Ultra Mac Studio 上 Qwen3-235B8-bit的张量并行 RDMA 基准测试结果三步完成 Exo 安装并跑起模型1. 准备设备至少 2 台 Apple Silicon Mac接入同一网络。要启用 RDMA设备需带雷电 5 接口、升级到 macOS 26.2并按全互联方式连接线缆。2. 安装 Exo最省事的途径是 macOS 客户端一条命令即可brew install --cask exo偏好源码运行的话Linux 亦可按仓库说明克隆并构建仪表盘后用 uv 启动uv run exo3. 加载模型并对话启动后访问 http://localhost:52415在内置控制台选择模型、创建实例即可直接对话也可以把现有的 OpenAI 客户端指向同一地址发请求。接口实现的入口在 src/exo/api/。Exo 新手常见疑问问硬件有什么要求答Apple Silicon Mac 是当前主力支持平台Linux 目前以 CPU 推理运行GPU 支持仍在开发。RDMA 需要雷电 5 设备与 macOS 26.2。问多台设备必须是同一型号吗答不必。Exo 依据每台设备实际的内存与算力做切分不同配置的设备可以混在同一个集群里。问能和现有工具配合使用吗答Exo 同时提供 OpenAI Chat Completions、Claude Messages、OpenAI Responses 与 Ollama 四种兼容接口原有脚本和客户端基本无需改动。Exo 的价值在于把分散的设备内存变成可共享的模型容量适合想本地运行大模型、又不想采购服务器的使用场景。想进一步查看端点定义与请求格式可阅读官方文档docs/api.md。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考