ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单

单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单 单张RTX 3090怎么挑配置club-3090单卡部署选型指南附全部slug清单【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090在单张 RTX 309024 GB上跑本地大模型club-3090项目把各种引擎、量化、上下文的组合都封装成了开箱即用的slug配置名——你只需要从 slug 清单里挑一个两条命令就能让 Qwen3.6-27B、Gemma 4、MiMo 9B 等模型在你的 3090 上提供服务。本文带你 3 分钟看懂单卡部署选型逻辑并附上全部 14 个单卡 slug 的完整清单。1️⃣ 30秒快速选型按需求挑配置不用逐个看 slug先对号入座你的使用场景2026-09-23 官方推荐你的需求推荐 slug说明长上下文 视觉一张卡llamacpp/mimo9b-single-vision⭐MiMo 9B262K 上下文⚠️ 有注意事项长上下文 视觉追求模型能力llamacpp/qwen38-27b-single-iq4xsQwen3.8-27B q4_0 KV262K 实验性跑 Gemma 系列vllm/gemma-12b-single-int8-mtp满血 262K 上下文跑 Qwen3.6-27B默认vllm/minimal⭐✅ 生产级32K 上下文无视觉⚠️ 注意NVFP4 后缀的 slug 不能在 3090 上跑——它们需要 Hopper/Blackwell 架构sm 9.0。3090 是 Amperesm 86请避开清单里的*-nvfp4条目。完整决策表和每个 slug 的背景讨论见官方选型页 docs/SINGLE_CARD.md。2️⃣ 怎么读懂一个 slugslug 遵循引擎/模型量化拓扑-特性的命名规律例如vllm/minimal llamacpp/qwen38-27b-single-iq4xs ik-llama/ornith9b-single前半段是推理引擎vllm需 Docker、llamacppllama.cpp免 Docker、ik-llama后半段是模型 量化方式iq4xs、q8kxl、int8-mtp等 单双卡拓扑single/dual 特性vision视觉、mtp推测解码。每个 slug 都带一个状态标记决定你能不能直接启动标记含义启动方式✅ production生产级放心用switch.sh slug直接启动⚠️ caveats可用但有文档化的限制switch.sh slug直接启动 experimental / ️ preview实验性/预览需要--force incubating孵化中默认隐藏--list --all查看⚽ 带星号的⭐表示该模型在此拓扑下的默认配置。3️⃣ 全部单卡 slug 清单14 个以下是 docs/SINGLE_CARD.md 中由 tools/docs/slug_tables.py 从注册表自动生成的完整单卡 slug 清单Gemma 4 12B统一版| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-12b-single-int8-mtp| ⚠️ | 262,144 | |llamacpp/gemma-12b-single-q8kxl| | 262,144 | |vllm/gemma-12b-qat-w4a16-single| | 262,144 |Gemma 4 26B-A4BMoE| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-26ba4b-single⭐ | ⚠️ | 176,000 |MiMo V2.6 Distill Qwen 9B小米| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/mimo9b-single-vision⭐ | ⚠️ | 262,144 |Ornith 1.0 9B| Slug | 状态 | 最大上下文 | |---|---|---:| |ik-llama/ornith9b-single| | 262,144 |Qwen 3.6 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/minimal⭐ | ✅ 生产 | 32,768 | |vllm/qwen-27b-single-nvfp4| ⚠️ 需 sm 9.03090 不适用 | 65,536 |Qwen 3.6 35B-A3BMoE| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/qwen-35b-a3b-single-nvfp4| ⚠️ 需 sm 9.03090 不适用 | 131,072 | |vllm/qwen-a3b-preview-single| ️ 预览 | 8,192 |Qwen 3.8 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/qwen38-27b-single-iq4xs| | 262,144 | |llama-cpp-prism-mtp/qwen38-27b-single-ternary-mtp| | 262,144 | |llama-cpp-prism/qwen38-27b-single-ternary-pq2| | 262,144 | |vllm/qwen38-27b-single-nvfp4| | 65,536 | 每个 slug 背后对应一个 compose 文件如 models/qwen3.6-27b/vllm/compose/single/autoround-int4/minimal.yml所有条目统一登记在 scripts/lib/profiles/registry.yaml 注册表中。4️⃣ 三步启动从克隆到出词# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/cl/club-3090.git cd club-3090 # 2. 下载模型权重首次 bash scripts/setup.sh qwen3.6-27b # 3. 启动你选中的 slug bash scripts/switch.sh vllm/minimal bash scripts/switch.sh --force llamacpp/qwen38-27b-single-iq4xs # 类需 --force # 附赠看看你的机器到底能跑哪些 bash scripts/switch.sh --list # 按硬件过滤--all 含已退役条目首次运行不熟悉流程docs/GETTING_STARTED.md 有 5 分钟从克隆到curl出词的完整走查。5️⃣ 单卡部署前必知的 4 个坑Qwen3.6 单卡 vLLM 的悬崖vllm/minimal在累积上下文达到约21–26K tokens时会出现性能悬崖Cliff 2b仅影响单卡 vLLM Qwen3-Next 系模型llama.cpp 和 Gemma 无此问题。长会话请上双卡。空闲显存 ≠ 峰值显存启动后首条长 prompt 会多占 0.5–1.5 GB。若 slug 启动后在长 prompt 上崩溃把MAX_MODEL_LEN或GPU_MEMORY_UTILIZATION降 0.03调低即可。和桌面共享显卡优先降MAX_MODEL_LEN干净的 KV 切分GPU_MEMORY_UTILIZATION0.80通常低于 vLLM 启动剖析的下限。功耗墙也是配置项3090 的功耗上限对 prefill/decode 吞吐影响显著官方测过 Qwen3.6 在 3090 上不同功耗点下的表现曲线跑长任务前值得看一眼6️⃣ 进阶启动前先算显存够不够不想启动后再翻车项目自带 KV 缓存预算计算器 tools/kv-calc.py能在启动前预测某配置能否塞进你的显存误差带 ±1.5 GB# 24 GB 单卡能开到多大上下文 bash tools/kv-calc.py --model qwen3.6-27b --solve-max-ctx --vram 24 --mem-util 0.92公式推导和每个模型的校准数据都在 docs/KV_MATH.md硬件兼容性4090/5090/A6000 等见 docs/HARDWARE.md。总结想省心vllm/minimalQwen3.6-27B生产级32K或vllm/gemma-26ba4b-single176K想长上下文视觉llamacpp/mimo9b-single-vision或llamacpp/qwen38-27b-single-iq4xs3090 用户避坑所有*-nvfp4slug 与你无缘长 Qwen3.6 会话注意 21–26K 悬崖选型后一条switch.sh起飞翻车前先用kv-calc.py算一遍账 【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表