
如果你也像我一样这几年一直在本地跑大模型那大概率绕不开 Ollama。它简单、干净一个ollama run qwen3:8b就能把聊天窗口拉起来。但我必须说实话用了半年之后我开始觉得它只解决了“能跑”的问题没有解决“跑得舒服”的问题。让我产生这个念头的是 Unsloth Desktop。第一次在同事机器上看到它时我甚至有点怀疑一个做微调优化起家的团队怎么突然去做了桌面端推理工具后来自己装上、下载模型、跑通推理再到把模型接到 Claude Code 里试用我才意识到它想做的事情比普通图形化推理工具要宽不少它把“选模型、下载权重、做量化、起本地服务、接外部 Agent”整条链路揉成了一个桌面应用而不是再丢给你一堆命令。如果你也打算本地部署大模型或者想把本地方案接到 Claude Code 这种终端 Agent 上用这篇文章值得看一下。我会把从安装到接入的完整流程、实测感受、踩坑记录都写下来并解释每一步背后的原因而不是只贴命令。1. Unsloth Desktop 出现在这里的逻辑先解决模型下载和运行效率1.1 从“微调工具箱”变成“推理桌面端”不是拍脑袋Unsloth 这个名字老玩家应该不陌生。它在开源社区里最常见的形象是一个能把 LoRA 微调速度拉高很多、显存占用压低的训练加速库。以前做微调的人要提前装 CUDA、Pytorch再写一段 Python 脚本把模型加载进来选量化位宽配置数据集跑几十步验证。对不熟悉命令行的人而言那个门槛是真实存在的。Unsloth Desktop 等于把这套成熟的后端能力封装成了 GUI。我在界面上看到的不是模型