ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

exo 本地AI集群上手指南:如何把多台设备连起来跑 235B~671B 大模型

exo 本地AI集群上手指南:如何把多台设备连起来跑 235B~671B 大模型 exo 本地AI集群上手指南如何把多台设备连起来跑 235B~671B 大模型【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 是一个开源分布式推理框架能把局域网内的多台设备连成一个本地AI集群。它会自动把单台机器装不下的大模型拆到多台设备上运行适合想在 Apple Silicon 或 Linux 机器上本地跑大语言模型的个人与小型团队。它适合什么场景以 235B 参数的 Qwen3 为例8-bit 量化后权重约需 235GB 内存单台消费级设备很难装下。用 exo把它放进 4 台 Mac Studio 组成的集群框架会自动感知每台设备的内存和网络链路再决定模型怎么切分。README 中的基准测试显示4 台 M3 Ultra Mac Studio 可运行 Qwen3-235B8-bit与 DeepSeek v3.1 671B8-bit张量并行在 2 台设备上最高约 1.8 倍加速4 台设备约 3.2 倍。除大语言模型外exo 还内置图像生成引擎实现如 Flux、Qwen 图像模型通过EXO_ENABLE_IMAGE_MODELS环境变量开启。项目能力速览能力方向提供什么相关模块使用时的注意点组网设备互相自动发现无需手工配网src/exo/shared/topology.py拓扑按实时链路构建推理MLX 后端张量/流水线两种切分src/exo/worker/engines/mlx/macOS 走 GPULinux 目前是 CPU接口OpenAI、Claude、Responses、Ollama 四套 APIsrc/exo/api/adapters/现有客户端工具可直连模型来源内置模型卡支持 HuggingFace 自定义模型src/exo/download/trust_remote_code默认关闭管理界面内置仪表盘查看集群、对话模型dashboard/默认端口 52415低延迟链路RDMA over Thunderbolt 5rust/networking/需 macOS 26.2 与 TB5 硬件第一次运行需要准备什么环境。macOS 需要 Xcode提供 Metal 工具链、brew、uv、node、rustnightly另需安装仓库指定的 macmon 固定版本用于硬件监控Linux 需要 uv、node 18 和 rust nightly。如果 macOS 上装了 Nix可直接执行nix run .#exo跳过手工依赖配置。资源。克隆代码git clone https://gitcode.com/GitHub_Trending/exo8/exo。模型权重首次使用时自动下载默认存到 macOS 的~/.exo/models、Linux 的~/.local/share/exo/models本地磁盘紧张时可用EXO_MODELS_DIRS指向外置 SSD。配置。仪表盘是前端工程先构建一次cd exo/dashboard npm install npm run build。同一局域网有多个 exo 集群时用EXO_LIBP2P_NAMESPACE做命名空间隔离避免集群互相发现。启动。运行uv run exo仪表盘和 API 都会起在http://localhost:52415。算力弱但网络好的机器可以加--no-worker参数只当协调节点加入集群。验证。先用 Llama-3.2-1B 这类小模型验证链路访问/instance/previews?model_idllama-3.2-1b查看全部可行切分方案及各自内存占用选定后创建实例再发一条 OpenAI 格式的聊天请求能收到正常回复即说明链路通了。关键模块怎么看src/exo/master/主节点所在其中 placement.py 负责计算模型该如何切分到现有设备。src/exo/worker/plan.py节点级任务调度管理下载、加载、预热、运行等 runner 状态流转。src/exo/shared/topology.py把网络拓扑组织成图结构记录节点间每条链路是 socket 还是 RDMA。src/exo/api/adapters/四套 API 兼容适配入口请求与响应字段定义在 src/exo/api/types/。bench/exo_bench.py测量各切分方案下的 prefill 与生成速度可按节点数、切分方式、后端过滤。docs/api.md完整 REST API 参考想用脚本对接时先读它。常见问题与调优建议不知道选哪种切分方式怎么办不要凭感觉选。/instance/previews会列出所有可行摆放及其内存变化挑一个内存留有余量的方案方案在仪表盘里随时可换。为什么在 Linux 上跑不快exo 目前在 macOS 上用 GPU 加速Linux 上暂为 CPU 推理。追求速度的话建议以 Apple Silicon 设备组集群。启用雷雳 RDMA 需要满足什么需要 macOS 26.2 以上、支持 TB5 的 MacM4 Pro Mac mini、M4 Max Mac Studio、M4 Max MacBook Pro、M3 Ultra Mac Studio和 TB5 线缆且每台设备要与集群内其他设备直连Mac Studio 上避开网线口旁边的 TB5 口在恢复模式执行rdma_ctl enable并保持所有设备的系统版本完全一致。下载自定义模型安全吗来自 HuggingFace 且需要trust_remote_code的模型默认不会执行远程代码保持默认更安全只有确认信任该模型来源时再打开。下一步可以做什么集群跑通后做一个小对比用 bench/exo_bench.py 对同一个小模型分别加--sharding tensor和--sharding pipeline配合--max-nodes 2各测一轮对比结果里的 prompt_tps 与 generation_tps直观了解哪种切分在你的硬件上占优。测量口径可延伸阅读 bench/METHODOLOGY.md。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表