
简介这份指南面向Windows 11用户围绕如何利用Ollama在本地运行DeepSeek-R1展开适合AI技术爱好者、开发者以及因数据隐私或网络延迟而不愿使用云端服务的实践者。文档从搭建环境讲起先说明硬件要求包括多核处理器、独立显卡、内存容量、固态硬盘等方面的具体建议再指导软件安装涵盖下载安装包、启动Ollama服务、拉取模型、检查模型列表和通过命令行发起对话。除了基础用法还展示了通过REST API调用模型的Python代码示例并介绍如何使用Modelfile调整温度系数、采样范围等参数来定制输出风格文档同时总结了常见问题如模型拉取失败、运行速度慢、服务端口被占用时可以尝试的检查和解决方法。整份资料只有一个PDF文件压缩包只有264KB内容紧凑而完整适合从零上手也可以作为部署后的速查手册。目前已有4333人学习下载对于想要在Windows 11上获得低延迟、高可控、可自定义的本地大模型体验这份指南能提供清晰可执行的参考。1. 本地跑 DeepSeek-R1 这件事没你想的那么玄2025 年刚过完年DeepSeek-R1 就成了大模型圈子里绕不开的名字。很多人第一反应是这种级别的模型必须租云端 GPU 才能跑实际上用 Ollama 在 Win11 上本地部署 DeepSeek-R1一条pull命令加一条run命令就能把模型拉到本地跑起来数据不出机器响应速度也不受网络波动影响。这份指南解决的就是“在 Windows 11 上把 DeepSeek-R1 跑通”这件事适合不想把数据传到云端、想先本地验证效果、或者准备把大模型接入内部工具的开发者和运维。接下来我按自己实操过的顺序拆解安装、拉取、调参和踩过的坑。2. 为什么是 Ollama DeepSeek-R1选型理由、硬件边界与安装准备2.1 选型理由本地部署大模型为什么先选 Ollama本地跑大模型社区里目前最常见的方案是 Ollama 和 llama.cpp 这两类。Ollama 的特点是封装了模型下载、格式转换、服务启动和 API 暴露用户只需要和几个命令打交道不用自己编译 C 工程。llama.cpp 性能上限更高但需要手动下载权重、转换 GGUF 格式、管理构建参数对新手来说门槛高了不少。DeepSeek-R1 本身是开源模型权重文件可以直接从 Ollama 的模型库拉取所以“Ollama DeepSeek-R1”是当前 Win11 上最快能跑通的组合这也是我把这份指南落地的首选。选型时要先确认一件事DeepSeek-R1 的完整版参数规模很大普通 PC 基本跑不动Ollama 上能直接拉取的是蒸馏版本常见的有 1.5B、7B、8B、14B 等。这些蒸馏版保留了 R1 的推理风格但参数规模小很多日常问答、摘要、代码生成够用而且能在个人电脑上跑起来。我一般建议先从 7B 或 8B 开始试跑通全流程后再考虑更大尺寸。如果你要的是数学、代码推理能力最强的模型蒸馏版会有一定缩水但作为本地私有部署的起步方案已经足够了。本地部署还有一个容易被忽略的好处数据隐私。用在线 API 时你的 prompt 和上下文会经过云端服务敏感代码或内部文档不适合直接传出去。Ollama 跑在本地所有请求都在本机处理这个特性对做内部工具、处理业务数据的人来说是硬需求。虽然本地模型效果可能不如云端旗舰模型但“能力换隐私”这笔账在很多场景里是划算的。2.2 硬件要求CPU、内存、显存与磁盘的边界原文给的硬件建议是 i7 / Ryzen 7 以上、16GB 内存、20GB 磁盘、NVIDIA GPU。实际操作中我认为最该先看的是内存和显存。Ollama 拉取的模型默认是 GGUF 格式的量化版本7B 模型量化后大约占用 4~6GB运行时还要留一部分空间给上下文缓存所以 16GB 内存是及格线32GB 会更从容。如果内存不够模型加载时会出现明显的卡顿甚至直接被杀进程。纯 CPU 推理不是不能跑只是生成速度慢得让人难受。我曾在没有 NVIDIA 显卡的笔记本上用 7B 模型做过测试生成速度大约每秒几到十几个 token回答稍长就要等几十秒。有 NVIDIA 显卡且支持 CUDA 的话Ollama 会自动把推理放到 GPU 上体验完全是两回事。显卡建议 RTX 30 系列或更新8GB 以上显存跑 7B 模型比较舒服显存不足时模型会退回到 CPU 推理速度断崖式下降。磁盘方面模型文件、临时下载文件、日志加起来至少按 20GB 预留。我强烈建议把 Ollama 的模型存储目录改到非系统盘避免 C 盘被模型文件塞满后面在拉取模型部分我会给出具体改法。硬件不达标的机器也能跑要么等要么换更小的量化版本别硬上大模型。2.3 软件准备Win11 更新、Ollama 安装与离线安装包软件侧先做三件事。第一确认 Win11 系统已经更新到最新版避免底层网络组件或 OpenSSL 相关的兼容问题。我遇到过旧版本 Win11 拉取模型时 TLS 握手失败更新系统后问题消失。第二从 Ollama 官网下载 Windows 安装包普通网络环境直接下一步安装即可。第三如果官网下载速度不理想可以找 Ollama 在 GitHub Releases 上的离线安装包下载后本地安装效果一致。安装完成后在 PowerShell 里执行ollama --version看到类似ollama version is 0.x.x的输出说明主程序装好了。这时别急着拉模型先把模型存储路径改掉。常见做法是设置环境变量OLLAMA_MODELS例如指定到D:\ollama\models然后重新打开终端或重新登录。原因很简单模型文件动辄几个 GB放在 C 盘除了拖慢系统还容易在拉取大模型时把系统盘剩余空间吃光等到想清理时才发现没有后悔药。修改环境变量的路径一定要保证存在Ollama 不会自动创建不存在的目录。3. 部署流程从 ollama serve 到 ollama run 的完整操作3.1 启动服务与端口检查安装完成后打开“命令提示符”或 PowerShell执行ollama serve这个命令会在当前终端启动一个 Ollama 服务进程输出类似Listening on 127.0.0.1:11434的内容说明服务已经监听 11434 端口。注意这个命令是阻塞式的窗口不能关闭否则服务会停。另一个容易忽略的点是如果你改了OLLAMA_MODELS环境变量先确认环境变量生效后再启动服务顺序反了会加载不到模型。端口检查可以在另一个窗口执行netstat -ano | findstr :11434如果有进程监听该端口说明服务正常。如果端口被占用后面的避坑章节我会专门写处理方法。这一步的意义是后续无论是命令行交互还是 REST API 请求本质上都是往这个端口发请求端口通了整条链路才成立。执行ollama serve时如果看到报错优先检查端口。3.2 拉取 DeepSeek-R1ollama pull 的进度、下载慢与镜像源处理服务起来后拉取模型用ollama pull deepseek-r1:7b注意模型名要写对。Ollama 模型库中 DeepSeek-R1 有多个 tag例如deepseek-r1:1.5b、deepseek-r1:7b、deepseek-r1:8b、deepseek-r1:14b等不写 tag 时默认拉取最新推荐的版本但为了可复现我建议每次显式写出 tag。这条命令会把 GGUF 格式的权重文件下载到OLLAMA_MODELS指定的目录。下载过程里你会看到百分比进度条。这个进度条偶尔会卡住尤其是网络波动时此时不要立刻按 CtrlC。Ollama 支持断点续传我遇到过一次 70% 卡了十几分钟最后等它自己恢复并完成。真正需要担心的是长时间 0% 或报错这时常见原因是官方模型库域名连接不稳定。处理办法有两个一个是配置国内镜像源环境变量名通常是OLLAMA_BASE_URL或OLLAMA_MIRROR具体看使用的镜像服务文档另一个是切换网络环境后重新拉取。社区里常用的镜像源变化很快选一个最近更新过的地址设置完成后重启 Ollama 服务再试。如果完全是离线环境可以手动下载模型文件用ollama create导入。但离线导入需要本地已有 Modelfile且模型文件格式要匹配新手不建议折腾这条路。先走通在线拉取后续再研究离线方案会省事很多。3.3 验证模型列表与首次运行拉取完成后用ollama list输出中会有一行deepseek-r1:7b之类的记录说明模型已经在本地。然后直接运行ollama run deepseek-r1:7b 用三句话介绍量子计算第一次运行会加载模型到内存或显存需要等几秒到几十秒。加载完成后再输入问题终端会流式输出回答。这个交互方式和 Chat 类产品类似只是完全在本地完成。如果模型回答内容不理想先别急着改 prompt检查一下模型版本和参数后面第 5 章会专门讲参数调整。补充一个细节如果你有 NVIDIA GPU且驱动和 CUDA 环境没问题Ollama 会自动检测并加载 GPU 运行。可以用ollama ps查看当前运行的模型以及它占用的显存ollama ps这个命令能看到模型名称、进程 ID、CPU/GPU 占用和保持加载的时间。对排查“模型有没有真跑在 GPU 上”很有帮助。如果输出里显示100% GPU说明推理完全走显卡如果显示100% CPU说明显卡没有被正确启用需要检查驱动或环境变量。4. 避坑手册本地部署 DeepSeek-R1 最常见的 5 个问题4.1 模型下载慢、中途失败或长时间没进度现象执行ollama pull后进度条停在某处不动或者报failed to get model manifest。原因Ollama 默认从官方模型库下载网络链路不稳定时就会出现长时间无进度另一个隐藏原因是磁盘空间不足下载线程写不进去但不会立刻报错。解决先用资源管理器确认OLLAMA_MODELS所在磁盘的剩余空间至少留出模型文件两倍的空间再考虑配置国内镜像源设置OLLAMA_BASE_URL或OLLAMA_MIRROR后重启服务如果还不行就切换网络环境后重新执行 pull断点续传会从上次进度继续。4.2 端口 11434 被占用现象启动ollama serve时提示端口绑定失败或者运行ollama run时报连接不上。原因电脑上已有其他程序占用了 11434 端口或者之前启动的 Ollama 服务没有正常退出。解决用netstat -ano | findstr :11434找到占用端口的进程 ID接着在任务管理器里结束该进程或者重启电脑。如果有其他服务必须占 11434可以在环境变量里把OLLAMA_HOST改成127.0.0.1:11435但注意客户端请求时也要带上对应端口否则还是连接不上。4.3 模型加载后回答速度极慢现象同一个问题在别人的机器上几秒出结果自己等了一两分钟才蹦几个字。原因大概率是 CPU 推理或者 GPU 没有被正确使用。有可能是显卡驱动版本太低也有可能是 Ollama 没有识别到 GPU。解决先用ollama ps查看模型跑在 CPU 还是 GPU如果是 CPU确认显卡驱动装了没在启动服务时留意日志里有没有类似nvidia字样的输出如果硬件确实不支持 GPU建议换用更小的模型比如deepseek-r1:1.5b速度会有明显提升。4.4 修改 OLLAMA_MODELS 后模型找不到了现象改了模型存储目录重新启动服务后执行ollama list一片空白。原因新目录是空的旧目录里的模型没有迁移过去。Ollama 只会读取当前环境变量指向的目录不会自动同步旧目录。解决把旧目录下的模型文件整体移动到新目录注意移动前先关闭 Ollama 服务移动完成后重新启动再ollama list验证。如果模型文件已经被删除只能重新ollama pull所以改路径前最好先确认旧目录里有完整模型。4.5 自定义 Modelfile 后运行报错现象执行ollama create时提示找不到模型或者参数格式错误。原因Modelfile 里FROM后面写的模型名和现有模型不一致或者参数名写错。Ollama 只认它定义好的参数关键字写错会直接报错。解决检查 Modelfile 里的模型名是否和ollama list输出完全一致包括 tag参数只支持temperature、top_p、top_k、num_ctx等关键字不要写模型本身不支持的参数。改完后重新执行ollama create确认没有报错再运行。5. 把 DeepSeek-R1 接入你的程序REST API 验证与参数固化5.1 用 Python 快速验证 API 是否可用命令行交互只是第一步实际工程里更多场景是通过 API 把模型接进自己的程序。Ollama 启动后默认暴露 REST API先写个最小请求验证连通性import requests data { model: deepseek-r1:7b, prompt: 用一句话解释什么是本地部署, stream: False } response requests.post(http://127.0.0.1:11434/api/generate, jsondata) print(response.json()[response])这段代码会把 prompt 发给本地 Ollama 服务stream设为False表示等完整回答返回后再打印。如果你在脚本里看到正常回答说明 API 链路已经打通接下来就可以接进自动化流程了。参数model要和ollama list里的名字完全一致否则接口会报模型不存在。5.2 通过 Modelfile 固化一套自定义推理参数Ollama 允许用 Modelfile 派生一个自定义模型。比如想让回答更稳定、减少随机性可以创建一个Modelfile文件内容如下FROM deepseek-r1:7b PARAMETER temperature 0.5 PARAMETER top_p 0.9 PARAMETER num_ctx 4096然后在终端执行ollama create my-deepseek-r1 -f Modelfile这条命令会从基础模型派生一个新配置temperature控制随机性值越小输出越保守top_p控制核采样范围num_ctx控制上下文窗口长度。创建完成后用ollama run my-deepseek-r1启动自定义模型或者在 API 请求里把model改成my-deepseek-r1。从那以后我每次部署新机器都会先改好OLLAMA_MODELS、确认磁盘空间、写完 Modelfile 再拉模型这套顺序帮我避开了不少重复踩坑的麻烦希望帮到你。本文还有配套的精品资源点击获取