ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

little-coder局域网部署指南:GPU主机推理+笔记本远程使用,跨设备跑本地大模型

little-coder局域网部署指南:GPU主机推理+笔记本远程使用,跨设备跑本地大模型 little-coder局域网部署指南GPU主机推理笔记本远程使用跨设备跑本地大模型【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder 是专为本地小模型调优的编码代理coding agent本指南带你完成完整的局域网部署在 GPU 主机上运行 llama.cpp 推理服务笔记本上启动 little-coder 远程连接实现「GPU 主机推理 笔记本远程使用」跨设备跑本地大模型无需任何云端 API。1️⃣ 为什么值得在局域网里跑本地大模型本地小模型最大的痛点是硬件模型吃显存而你写代码的笔记本往往没有独显。局域网部署的思路很简单——把推理和交互拆到两台设备GPU 主机台式机 / 旧工作站 / 矿卡主机跑 llama.cpp 或 Ollama负责本地大模型推理笔记本只装 little-coder 客户端依赖 Node.js ≥ 22.19通过 WiFi 调用 GPU 主机的推理接口。little-coder 的默认模型就是为这个场景准备的llamacpp/qwen3.6-35b-a3b见 models.json8 GB 显存即可运行MoE 专家放内存、注意力放显存的技巧实测可跑出约 44 tok/s。官方基准也全部跑在 8 GB 显存的消费级笔记本 GPU 上小模型 合适脚手架的效果相当能打多语言场景下同样稳定Python / Java / C / JS / Go / Rust 全部领先2️⃣ 部署前准备两台设备清单角色设备要求服务端GPU 主机一块带驱动 CUDA 的显卡8 GB 显存起步Linux 示例客户端笔记本Node.js ≥ 22.19能 ping 通 GPU 主机即可两者接入同一个路由器 / 局域网即可不需要公网不需要代理。3️⃣ GPU 主机把推理服务开放到局域网以 little-coder 官方推荐的 llama.cpp Qwen3.6-35B-A3B 为例完整步骤见 README.md 的Serving from another machine on your LAN一节构建并启动llama-server关键区别只有一个用--host 0.0.0.0替代127.0.0.1让服务监听局域网接口build/bin/llama-server -m ~/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --mmproj ~/models/mmproj-F16.gguf \ --host 0.0.0.0 --port 8888 --jinja \ -c 16384 -ngl 99 --n-cpu-moe 999 --flash-attn on用其他推理后端也一样只需把监听地址改为0.0.0.0OllamaOLLAMA_HOST0.0.0.0:11434 ollama serveLM Studio在 Server 页开启Serve on local network默认端口 1234查出主机的局域网 IPLinux 用hostname -ImacOS 用ipconfig getifaddr en0假设是192.168.1.50。4️⃣ 防火墙放行LAN 部署最常见的超时元凶 ⚠️如果 GPU 主机开着ufw/firewalld默认拒绝策略会静默丢弃来自笔记本的连接现象是请求卡住不超时返回、收不到 RST。只放行你的局域网网段到推理端口即可不要把端口暴露给公网sudo ufw allow from 192.168.1.0/24 to any port 8888 proto tcp sudo ufw status verbose # 确认规则生效 一个隐蔽的坑Docker 发布出去的端口会绕过 ufwPREROUTING NAT所以可能出现「Docker 容器里的推理服务能连上、同主机裸跑的 llama-server 连不上」排查时先看ufw status verbose。5️⃣ 笔记本安装 little-coder 并指向 GPU 主机客户端安装一行搞定需要 Node.js 22.19npm install -g little-coder然后把 little-coder 的 llama.cpp 客户端指向 GPU 主机。little-coder 的 provider 注册全部由数据驱动models.json 用户覆盖文件而*_BASE_URL环境变量优先级最高、可以直接换成任意局域网地址# 本地推理服务也需要一个占位 key服务端会忽略它 export LLAMACPP_API_KEYnoop export LLAMACPP_BASE_URLhttp://192.168.1.50:8888/v1 # 先做一次连通性自检能列出模型说明链路通了 curl -s http://192.168.1.50:8888/v1/models | head用 Ollama / LM Studio 做服务端的话对应的就是OLLAMA_BASE_URLhttp://192.168.1.50:11434/v1、LMSTUDIO_BASE_URLhttp://192.168.1.50:1234/v1。6️⃣ 启动验证跨设备跑本地大模型的完整流程cd ~/your-project little-coder --model llamacpp/qwen3.6-35b-a3b启动后做两件事确认部署成功看状态栏底栏右侧显示qwen3.6-35b-a3b • medium即模型已选中。little-coder 会在启动时自动探测 llama.cpp 的实时上下文长度/props你传什么-c就是什么无需手改配置盯CH字段CH99.8%这类高缓存命中率说明服务端前缀缓存在正常工作。长对话里CH持续偏低说明服务器在反复重算历史值得回查服务端配置。本地推理比云端慢一些上图为官方基准中 little-coder 的单题耗时分布但换来的是零成本、零隐私外流、断网可用——这正是局域网部署本地大模型的全部意义。7️⃣ 常见问题排查清单症状原因解决ECONNREFUSED 127.0.0.1:8888笔记本上还在连本机检查LLAMACPP_BASE_URL是否指向 GPU 主机 IP请求卡住、无 RST、不报错服务端防火墙丢弃 SYN按第 4 节放行局域网网段到 8888 端口curl /v1/models能通但 little-coder 报 401缺占位 keyexport LLAMACPP_API_KEYnoop后重试图片附件返回 4xx服务端没带视觉投影器服务端加--mmproj参数重启更多细节上下文窗口调大、按阶段分配 plan/action 模型等可直接翻阅 README.md 与 docs/ 目录下的文档。总结整个局域网部署可以归纳成一句话服务端把127.0.0.1换成0.0.0.0 放行防火墙客户端把BASE_URL指向 GPU 主机 IP。三步之后笔记本上的 little-coder 就能流畅调用局域网里的本地大模型写代码、跑测试、查 bug全程不出内网。【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表