
三步跑通本地大模型推理Qwen-Agent LM Studio 本地化部署完整指南【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent企业内网、敏感数据不能出域云 API 被直接排除在选项之外。本文用 Qwen-Agent LM Studio 完成本地化部署不改一行框架代码本地模型接管数据分析与文档问答推理只发生在你自己的机器上。原理LM Studio 的 OpenAI 兼容接口如何对上 Qwen-Agent 抽象层LM Studio 的 Server 选项卡暴露的/v1/chat/completions端点遵循标准 OpenAI 协议。Qwen-Agent 的 LLM 抽象层按供应方注册适配器其中oai适配器的本质是把api_base指向任意 OpenAI 兼容端点。两边在协议层天然对齐所以对接本地模型不需要写适配代码只需要一份指向本地的配置。# qwen_agent/llm/oai.py 中的地址解析逻辑字段有别名任选其一 api_base cfg.get(api_base) or cfg.get(base_url) or cfg.get(model_server) api_key cfg.get(api_key) or os.getenv(OPENAI_API_KEY) or EMPTY也就是说model_type填oaiapi_base填本地地址链路就通了。操作三步把本地模型接入 Qwen-Agentgit clone https://gitcode.com/GitHub_Trending/qw/Qwen-Agent cd Qwen-Agent pip install -e .第一步安装 LM Studio 并加载量化模型从 LM Studio 官网下载安装首次打开后在模型搜索区拉取 Qwen 系列 GGUF 模型建议 Qwen2.5-7B-Instruct 起步。在模型页选择量化档位加载Q4_K_M是默认推荐7B 模型约占 5GB 显存8GB 显卡即可运行16GB 以上可换Q5_K_M或 14B 档位换更高上限。加载后确认模型状态为已就绪记下 Server 面板显示的模型名后面配置要用。第二步启动本地推理服务端口 1234切到 LM Studio 的Server选项卡。确认右上角选中的模型与端口默认1234被占用就改1235之类后面配置同步修改。点 Start Server状态灯变绿即启动成功。用一条命令确认服务在线curl http://localhost:1234/v1/models返回包含模型名的 JSON 即可进入下一步。第三步编写 llm_cfg 指向 http://localhost:1234/v1全部对接逻辑浓缩在这份配置里llm_cfg { model: qwen2.5-7b-instruct, # LM Studio Server 面板显示的模型名 model_type: oai, # 走 OpenAI 兼容适配器 api_base: http://localhost:1234/v1, api_key: lm-studio, # 任意非空值均可 generate_cfg: {max_new_tokens: 2048, temperature: 0.7}, }三个关键字段model必须与/v1/models返回的名字一致model_type固定oaiapi_base指到本地端口。api_key本地服务不校验非空占位即可。验证跑通最小对话测试再试两个实战玩法先确认链路。五行使够from qwen_agent.agents import Assistant assistant Assistant(llmllm_cfg) rsp list(assistant.run(用一句话介绍你自己。)) print(rsp[-1][content])能打印出模型自述说明本地推理服务、适配层、Agent 三层全部打通。玩法一代码解释器。给ReActChat挂上code_interpreter工具本地模型就能自己写 Python、执行并出图参考 code_interpreter 工具源码from qwen_agent.agents import ReActChat bot ReActChat(llmllm_cfg, function_list[code_interpreter]) print(list(bot.run(生成一张正弦曲线图并保存为 sin.png)))玩法二本地文档问答。ParallelDocQA支持在消息里直接带file字段传入 PDF全程离线处理from qwen_agent.agents.doc_qa import ParallelDocQA bot ParallelDocQA(llmllm_cfg) print(list(bot.run([{role: user, content: [ {text: 一句话总结这篇论文的核心结论}, {file: paper.pdf}]}])))调优参数调优与常见问题对照表现象可能原因处理方式请求localhost:1234直接超时Server 未启动或端口被占用回 Server 选项卡确认绿灯换端口后同步改api_base首 token 或整段生成很慢模型偏大、量化档位过高7B Q4_K_M起步max_new_tokens降到 1024长对话先截断上下文不知道选什么模型档位显存预算不清晰8GB 显存7B Q416GB 显存14B Q4 或 7B Q5挂工具后 Agent 不执行如 code_interpreter本地模型不支持 function calling 格式换 Qwen 系列 instruct 模型小参数模型退化为纯对话属预期行为输出重复、胡言乱语采样参数失控temperature压到 0.7 以下top_p保持 0.8 左右生成速度与质量冲突时优先降量化档位而不是降模型规模——Q4_K_M与Q5_K_M的速度差距小质量差距明显。本地化部署到此收束数据不出内网推理跑在自己机器上边际成本只算电费。更多字段与配置说明见 llm 适配层源码 和 官方文档。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考