ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Qwen3 MoE:30B 总参、A3B 激活,稀疏专家路由怎么省算力

Qwen3 MoE:30B 总参、A3B 激活,稀疏专家路由怎么省算力 Qwen3 MoE30B 总参、A3B 激活稀疏专家路由怎么省算力【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5Qwen3 仓库收录了 Qwen 系列大模型的技术报告、部署与评测资料。MoE 模型是其中算力性价比最高的形态总参上百 B每个 token 只激活几 B靠专家路由把大模型装进单卡显存。类比拆解MoE 路由像医院分诊台把 Transformer 的 FFN 层想成医院后厨。Dense 模型像每个病人token都要让所有诊室专家会诊一遍人全到齐但多数是陪跑MoE 像分诊台每个 token 先被路由网络分诊只去得分最高的少数专家号诊完把处方专家输出加权合在一起。类比失效的边界分诊台按病种把病人固定分给科室而 Qwen MoE 的路由是按 token 动态打分的同一句话里不同 token 可以走完全不同的专家组合而且专家不是科室是同一结构里并行的多组权重。关键参数速查30B-A3B 与 235B-A22B参数Qwen3-30B-A3BQwen3-235B-A22B总参 / 激活参30B / 3B235B / 22B上下文256K2507 版可扩展 1M (README.md)256K2507 版可扩展 1M (README.md)框架transformers ≥4.51.0vLLM ≥0.9.0llama.cpp ≥b5401mlx-lm ≥0.24.0 (README.md)同左总参决定显存、A 后面的数字决定每个 token 的算力成本这两个数字就是选型依据。30B-A3B 在 H20 单卡 BF16 下占 58462MB 显存、吞吐 137.18 tokens/s而同级 32B Dense 只有 20.72 tokens/s (speed_benchmark.md)。具体 K 值与专家数量仓库未公布以官方 benchmark 为准。最小可跑示例30B-A3B 一条命令验证python -c from transformers import AutoModelForCausalLM, AutoTokenizer; \ tAutoTokenizer.from_pretrained(Qwen/Qwen3-30B-A3B-Instruct-2507); \ mAutoModelForCausalLM.from_pretrained(Qwen/Qwen3-30B-A3B-Instruct-2507, torch_dtypeauto, device_mapauto); \ print(t.decode(m.generate(**t([t.apply_chat_template([{role:user,content:hi}], tokenizeFalse, add_generation_promptTrue)], return_tensorspt).to(cuda))[0].input_ids[0], skip_special_tokensTrue))预期输出模型返回一段流畅的英文回复如 Hello! How can I help you today?即说明 MoE 路由与专家权重加载均正常。BF16 需约 58GB 显存参考 speed_benchmark.md 的 H20 96GB 环境。选型判断你的场景适不适合 MoE如果你的目标是用更少激活参数换更大模型容量单卡显存紧张但想要接近旗舰的效果30B-A3B 的 BF16/FP8 是仓库 benchmark 里覆盖最全的档位如果你需要高并发服务直接上 vLLM/SGLang 起 OpenAI 兼容 API235B-A22B 用 8 卡 TP8 可跑 BF16 (README.md)不建议想用 Transformers 直接加载 30B-A3B 的 GPTQ-INT4 量化版——仓库明确标注 MoE Kernel Unsupported (speed_benchmark.md)应改用 BF16/FP8 或走 vLLM/SGLang 部署。跑通之后看这里vLLM 部署指南量化实践AWQ / GPTQARC-AGI-1 评测代码235B-A22B-Instruct-2507 实测【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表