ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

4台Mac组AI集群跑235B大模型:exo本地分布式推理实操

4台Mac组AI集群跑235B大模型:exo本地分布式推理实操 4台Mac组AI集群跑235B大模型exo本地分布式推理实操【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo一台 M3 Ultra 装不下 235B 的模型买 GPU 又太贵闲置的 Mac 只能吃灰。exo 就是把这些 Mac 组成 AI 集群、跑大模型的工具面向想本地部署大模型但不买 GPU 的开发者。一句话说清 exo 是什么exo 把多台 Mac 连成一个 AI 集群跑单台装不下的大模型。三个数字张量并行 4 台设备最高 3.2 倍加速RDMA over Thunderbolt 把设备间延迟降 99%4 台 M3 Ultra 跑 Qwen3-235B 达 31.9 t/s。原理速览像餐厅传菜员切订单自动并行这件事可以想成餐厅。客人点了个巨型套餐大模型单个档口单台 Mac做不完。传菜员exo看一眼每个档口的锅有多大、灶台多热再决定哪几道子菜交给哪个档口顺便安排好传菜路线。哪台设备负责哪部分权重、链路走哪条都由它实时算。设备之间也不用你配跑着 exo 的 Mac 会自动发现局域网里的同类插上 TB 线就能组队。实测数据怎么看基准硬件4 台 M3 Ultra Mac Studio各 512GB 内存TB5 线全互联RDMA 已启用。生成速度数字来自 exo RDMA 方案。模型单节点2 节点4 节点4 节点 vs 单节点Qwen3-235B A22B8-bit19.5 t/s26.2 t/s31.9 t/s64%DeepSeek V3.1 671B8-bit21.1 t/s27.8 t/s32.5 t/s54%Kimi K2 Thinking 1TA32B4-bit单台 512GB 装不下。4 节点 exo RDMA 跑到28.3 t/s对照组 llama.cpp 走 TCP 只有 16.4 t/s。一个值得注意的对照同样 4 台设备llama.cpp 走 TCP 是 15.2 t/sexo 走 RDMA 是 31.9 t/s快 56%。瓶颈不在算力在链路。三步跑起来前置条件uv、nodeLinux 需 18、rustnightlymacOS 另需 Xcode。装依赖git clone https://gitcode.com/GitHub_Trending/exo8/exo然后cd exo/dashboard npm install npm run build。dashboard 和 Python 运行时都靠这一步就位。启动服务uv run exo。每台 Mac 各跑一遍节点自动互相发现不用手动加 IP。打开界面验证浏览器访问http://localhost:52415/看到拓扑图里节点全亮、能发起聊天就算成了。值得调的两个配置RDMA 开关。什么时候碰它macOS 26.2 以上、TB5 机型M4 Max、M3 Ultra且机器间要用 TB5 线全互联不满足就跳过。改哪里关机进恢复模式终端执行rdma_ctl enable重启exo 接管剩下的。改完的变化同样 4 台跑 Qwen3-235BTCP 方案 15.2 t/s开 RDMA 后 31.9 t/s设备间延迟降 99%。模型下载目录。几百 GB 权重塞不进 Mac 内置盘。什么时候碰它内置盘空间不够插一块外置 SSD 或挂 NFS。改哪里EXO_MODELS_DIRS/Volumes/ExternalSSD/exo-models uv run exo它按顺序找第一个空间够的目录写入。改完的变化下载和缓存全落到外盘内置盘只留系统和代码。适合谁不适合谁适合跑 200B 以上模型的人以及手里有两台以上 Apple Silicon 设备、想把闲置算力榨出来的人。不适合只需要单机推理的人装 Ollama 或 LM Studio 就够了组集群纯属多余。Linux 用户目前只跑 CPUGPU 支持还在开发中别抱 GPU 集群的期待。收一句开头那个结是一台装不下、买 GPU 太贵、闲置 Mac 浪费。exo 给的路子是后一条两台 Mac 插根 TB 线各跑一遍uv run exo看它们自动发现对方。比读十篇架构文档直观。更多 API 细节可以看仓库里的 docs/api.md 和 src/exo/master/api.py。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表