
Qwen3 快速上手一文讲清 0.6B 到 235B 的 MoE 大模型如何本地运行【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5Qwen3 是阿里云 Qwen 团队开源的大语言模型系列同时提供 Dense密集型与 MoE混合专家两种架构、0.6B 到 235B 共 8 种规格并支持思考模式与非思考模式。本文带你在一篇文章内搞懂Qwen3 该选哪个版本、如何在本地跑起来、部署时如何避坑。为什么「选哪个模型、跑哪个版本」常常劝退新手搜一圈「Qwen3 本地部署」你会被一串名字砸晕Qwen3-8B、Qwen3-30B-A3B、Qwen3-235B-A22B-Instruct-2507……同一个系列既有 Dense 也有 MoE还有 Instruct 与 Thinking 两种分支参数版本还跟着日期滚动更新2504、2507。对初学者来说第一步往往不是「怎么跑」而是「这些名字到底什么关系」。先看懂 Qwen3 的两种「人格」思考与非思考可以把 Qwen3-2507 系列理解为同一位专家的两种工作模式Thinking 版像「先打草稿再交卷」会先输出一段推理链再给出答案适合数学、代码和复杂逻辑题Instruct 版像「接到任务直接干」不生成think块响应更快适合日常对话和工具调用。早期 Qwen32504是一个模型兼两种模式靠参数切换2507 版本干脆拆成两个型号行为更清晰版本模式关键行为Qwen3-Instruct-2507仅非思考直接出答案不再需要传enable_thinkingFalseQwen3-Thinking-2507仅思考自动先推理后回答思考长度增加Qwen32504 原版双模式用enable_thinking参数或/think、/no_think指令切换4 步快速上手在本地跑起 Qwen3选规格0.6B / 1.7B / 4B 适合低端设备体验名字里的「A3B」「A22B」表示 MoE 模型每次前向仅激活约 3B / 22B 参数显存消耗远低于同规模的 Dense 模型30B-A3B 和 235B-A22B 是主力 MoE 型号。装运行环境最省事的是 Ollamav0.9.0 及以上或 llama.cppb5401 及以上Apple Silicon 用户可选 mlx-lm0.24.0 及以上。一条命令拉取并运行ollama run qwen3:8b需要对外提供服务时用 vLLM 一行启动兼容 OpenAI 的 API 服务vllm0.9.0接口在http://localhost:8000/v1vllm serve Qwen/Qwen3-8B --port 8000 --max-model-len 131072服务起来后任何走 OpenAI 协议的对话前端都能直接接上下图就是接上 Qwen3 后的本地聊天界面效果关键数据一览框架版本要求运行环境最低版本适用场景transformers4.51.0官方示例建议 Python 3.10 / PyTorch 2.6vLLM0.9.0高吞吐在线服务SGLang0.4.6.post1快速 ServingTensorRT-LLM0.20.0rc3NVIDIA 深度优化llama.cppb5401本地 / 边缘设备Ollamav0.9.0 及以上本地一键运行mlx-lm0.24.0Apple Silicon 设备模型谱系Dense 有 0.6B、1.7B、4B、8B、14B、32BMoE 有 30B-A3B、235B-A22B2507 版本支持 256K 上下文官方已提供扩展到 100 万 token 的模型卡。全部模型采用 Apache 2.0 协议。跑 Qwen3 的 3 个高频坑Ollama 默认上下文太短默认num_ctx只有 2048 且默认「无限生成」对 Qwen3 容易出错。启动后手动执行/set parameter num_ctx 40960和/set parameter num_predict 32768。推理内容会被中间层丢弃SGLang 与 vLLM 在预处理 API 请求时会丢掉reasoning_content字段可能拖累思考模型的多步工具调用质量。官方建议把完整内容原样传回不要手动截取出思考部分。思考版别给太小的生成长度Thinking 版思考长度明显增加max_new_tokens设小了会「想一半被打断」。官方示例中 Thinking 版用 32768Instruct 版建议 16384。延伸阅读仓库内文档快速上手示例Transformers、ModelScope、vLLM、SGLang 的完整推理代码与推荐采样参数temperature0.7, top_p0.8, top_k20。思考预算示例用两次调用限制思考长度适合对时延敏感的在线服务。速度基准各规格模型在不同上下文长度下的显存占用与 tokens/s 吞吐数据选规格前先看这张表。一句话总结Qwen3 的价值在于从笔记本能跑的 0.6B 到 235B 旗舰 MoE 共用同一套 API 与部署方案而该让模型「先想后答」还是「直接干活」由你按场景选对型号即可。【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考