ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

2080Ti 22G + LmStudio + Qwen3.8 27B 本地大模型部署

2080Ti 22G + LmStudio + Qwen3.8 27B 本地大模型部署 --------------------------------------------------------------------------请无视文章中的文字链接都是CSDN自己加上的--------------------------------------------------------------------------1、安装和模型下载安装 LmStudio在 model search 里搜索 Qwen3.8-27B-Q4_K_M 并下载。如果 LmStudio 内置下载太慢可以在 modelscope 网站下载 Qwen3.8-27B-Q4_K_M.gguf 文件然后手动放到 LmStudio 的模型文件夹内。路径为C:\users\用户名\.lmstudio\models\厂家名\模型名\Qwen3.8-27B-Q4_K_M.gguf其中用户名以自己电脑为准厂家名和模型名可以自己随便填文件下载完成或复制到路径下后会显示在 LmStudio 的模型列表中。下载时模型显示16.8G实际大小为15.6GCUDA 版本12.8.2测试环境E5-2673V3 2.4G(睿频2.7G) DDR3 32G 1866内存 x2 2080Ti 22GCPU和内存都比较慢其他测试环境大概率比我测出的速度要快一点。2、模型加载参数Context length131072GPU offload65全部加载到GPUCPU thread pool size4一般≥4就够了Max concurrent predictions1Speculative decodingMTPMax draft tokens22是一个比较合适的值也可以试试4K/V CacheQ4_0其他参数全部使用默认即可。3、使用1 使用 LmStudio 内置聊天和网页版差不多。2使用本机 agent 添加模型连接 LmStudio 端口在右下角托盘右键点击 LmStudio 可以复制服务http地址。3在其他电脑连接 LmStudio 端口使用需要在 LmStudio 模型 developer 界面打开网络服务然后在防火墙的入站和出站规则中添加1234端口的信任。这样在其他电脑上也能连到这个服务器使用了。注意如果打开了网络服务本机使用时也要更新成这个http地址。同样在托盘右键点击复制地址。4、最终表现显存占用19.8G也就是上下文还可以增加、内存占用31G。1使用 LmStudio 内置聊天文字输出速度大概 30 t/s代码输出速度大概 40 t/s。2使用本机 WorkBuddy 连接服务开启聊天首次上下文填充速度 500 t/s输出速度20~30t/s。3使用其他电脑 WorkBuddy 连接服务速度上没有太大区别。5、实测经验1满血版2080ti支持超频使用afterburner把显存频率 600到7400M内核频率100功耗墙拉到115%大概300W。实测整体输入输出性能可以提高10%。想更激进的超频可以自己试试注意电源要够。2Qwen3.8 27B 默认的思考开到最大了经常出现雷霆大思考先思考10分钟再干活。但是降低思考强度或者增加提示词来规避长时间思考输出质量会受一定影响。可以根据需求设置思考强度。在load菜单最下面的 llama.cpp arguments override里增加设置项 --reasoning_effort参数为xhigh、medium、low。设置为medium时思考时间短很多跑任务可能会节省一半的时间。3下载了 llama.cpp CUDA12.4 测试加载大模型用相同配置测试加载和输出速度和 LmStudio 差不多所以推荐直接用 LmStudio 就行了几乎没有性能损失上手难度也比较小。4注意有全局memory的agent软件比如 workbuddy如果在其他对话中修改了memory文件会导致和本地模型的对话上下文被修改导致重新加载全部上下文。5如果CPU主频比较低比如E5导致跑任务时出现某个核占用100%可以在BIOS里关闭超线程减小线程切换消耗来提高单核能力。6可以用GPUZ监控显卡主频如果GPU clock没有跑满会非常影响输出速度我发现WorkBuddy 和 LmStudio 同时运行时GPU主频会被锁在1200M实际应该是能跑到1800~2000M这时输入输出速度都会降低20%左右。经排查原因是 WorkBuddy 进行界面切换时会调用显卡图形计算导致CUDA和图形同时使用显卡功耗策略从P0被降级到P2。解决办法是重启然后只使用 LmStudio 不打开 WorkBuddy或者退出 WorkBuddy 然后重新打开后不要切换到其他对话界面。7Qwen3.6 35B A3B 的输出速度能到 80t/s和网页版差不多速度了但是实测编程任务实现效果比 27B 差太多写代码不是很推荐使用其他任务可以测试效果来决定是不是要用Qwen3.8 27B可以达到能用的水平但是体验上还是比较慢。仅推荐拿来处理不能联网的数据使用个人拿来跑任务不如用API划算。-------------------------------------------------------原创文章转载请注明出处。如有疑问或建议请在回复中说明谢谢
返回列表