ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek-R1 671B 模型下载与本地推理部署指南

DeepSeek-R1 671B 模型下载与本地推理部署指南 DeepSeek-R1 671B 模型下载与本地推理部署指南【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1DeepSeek-R1 是 DeepSeek 基于大规模强化学习RL训练的开源推理模型总参数 671B、激活参数 37B、上下文长度 128K在数学、代码与推理任务上表现出自我验证、反思和长思维链CoT能力。本仓库是 DeepSeek-R1 主模型的完整权重快照163 个 safetensors 分片外加 config.json、tokenizer 与 modeling_deepseek.py 建模代码。下文按怎么拿到 → 怎么跑起来 → 效果如何 → 遇到问题怎么办的顺序覆盖完整路径。 DeepSeek-R1 模型家族与规格速览R1 系列共 8 个模型2 个 671B MoE 主模型和 6 个基于 Qwen2.5 / Llama3 的蒸馏 dense 模型。本仓库只包含 DeepSeek-R1 主模型蒸馏模型在各自的独立仓库中发布。模型总参数激活参数上下文基础模型DeepSeek-R1671B37B128KDeepSeek-V3-BaseDeepSeek-R1-Zero671B37B128KDeepSeek-V3-BaseDeepSeek-R1-Distill-Qwen-1.5B / 7B / 14B / 32B1.5B / 7B / 14B / 32B同左—Qwen2.5 系列DeepSeek-R1-Distill-Llama-8B / 70B8B / 70B同左—Llama-3.1-8B / Llama-3.3-70B-Instruct主模型的架构关键点取自本仓库 config.json项配置值说明模型类型deepseek_v3DeepseekV3ForCausalLMMoE 架构与 DeepSeek-V3 相同层数61前 3 层为 densefirst_k_dense_replace: 3其余为 MoE 层专家256 路由 1 共享每个 token 激活 8 个路由专家num_experts_per_tok: 8注意力多头潜在注意力MLA128 个头KV 经kv_lora_rank: 512低秩压缩权重存储FP8e4m3128×128 分块激活采用动态量化计算 dtype 为bfloat16位置编码YaRN原训练长度 4096外推至最大 163840注意权重以 FP8 格式存储推理框架需支持 FP8 加载如 Hopper 架构 GPU 上的 vLLM/SGLang。 下载权重两条路线两种方式的适用前提不同任选其一即可完成后目录内都是可直接加载的完整文件。方式一huggingface_hub 快照下载适合能直连 HuggingFace、且有 Python 环境的场景断点可自动续传。from huggingface_hub import snapshot_download model_dir snapshot_download( repo_iddeepseek-ai/DeepSeek-R1, local_dir./deepseek-r1, ) print(model_dir) # 下载完成后直接作为本地模型目录使用方式二git clonegit-lfs适合批量传输、习惯用 git 管理的场景也可通过镜像源加速。前提是安装了git-lfs# 安装并初始化 git-lfs已安装可跳过 sudo apt-get install -y git-lfs git lfs install # 从镜像克隆完整仓库 git clone https://gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1下载完成后用两条命令核对完整性# 分片数量应为 163 ls model-*-of-000163.safetensors | wc -l # 核对索引文件引用的每个分片是否都存在 python3 -c import json,pathlib; mset(json.load(open(model.safetensors.index.json))[weight_map].values()); print(缺失:, [f for f in m if not pathlib.Path(f).exists()] or 无)⚙️ 影响推理行为的配置要点只列真正影响输出的参数。生成采样参数temperature/top_p/do_sample已固化在本仓库 generation_config.json 中按官方推荐值执行参数推荐值说明temperature0.6范围 0.5–0.7超出该范围易出现无限重复或输出不连贯top_p0.95与官方评测一致do_sampletrue必须开启采样最大生成长度32768官方评测的生成上限系统提示不要添加所有指令放在 user prompt 中数学题提示加入请逐步推理最终答案放在\boxed{}中便于提取答案输出前缀强制以think\n开头防止模型跳过思考直接作答另外官方建议评估模型表现时多做多次测试取平均单次输出具有波动性。 本地推理部署主模型与蒸馏模型主模型671B MoE仓库 README 明确提示HuggingFace Transformers 尚未直接支持 DeepSeek-R1 主模型本地运行方式以 DeepSeek-V3 仓库的说明为准vLLM、SGLang 等推理框架的多卡部署。加载时指向本地权重目录即可例如把示例中的模型名替换为./deepseek-r1路径。蒸馏模型1.5B–70B蒸馏模型按 Qwen/Llama 的方式使用无需额外建模代码。用 vLLM 起服务双卡部署 32B 示例--enforce-eager为官方推荐参数vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --tensor-parallel-size 2 --max-model-len 32768 --enforce-eager也可以用 SGLangpython3 -m sglang.launch_server \ --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --trust-remote-code --tp 2服务默认在 8000 端口提供 OpenAI 兼容接口。以下是最小调用示例请求本地服务完成一次带推理的问答from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modeldeepseek-ai/DeepSeek-R1-Distill-Qwen-32B, messages[{ role: user, content: 请逐步推理并给出 27 * 43 的计算过程。, }], temperature0.6, top_p0.95, ) answer resp.choices[0].message.content print(answer) # 输出形如 think…推理过程…/think 后接最终答案模型输出会先给出think…/think包裹的推理过程再给最终答案程序化使用时可按/think切分两段。 官方基准测试结果以下数据全部来自本仓库 README评测设置最大生成长度 32768采样温度 0.6、top-p 0.95每条查询生成 64 次估算 pass1。主模型 DeepSeek-R1基准GPT-4o 0513Claude-3.5-Sonnet-1022o1-minio1-1217DeepSeek-R1MMLU (Pass1)87.288.385.291.890.8MATH-500 (Pass1)74.678.390.096.497.3AIME 2024 (Pass1)9.316.063.679.279.8LiveCodeBench (Pass1-COT)34.233.853.863.465.9Codeforces (Rating)759717182020612029SWE Verified (Resolved)38.850.841.648.949.2蒸馏模型同源于 README 的 Distilled Model Evaluation 表模型AIME 2024MATH-500GPQA DiamondLiveCodeBenchCodeforces Ratingo1-mini参照63.690.060.053.81820Distill-Qwen-1.5B28.983.933.816.9954Distill-Qwen-7B55.592.849.137.61189Distill-Llama-8B50.489.149.039.61205Distill-Qwen-14B69.793.959.153.11481Distill-Qwen-32B72.694.362.157.21691Distill-Llama-70B70.094.565.257.5163332B 蒸馏模型在多数数学/代码项上超过 o1-mini是 70B 以下部署的常见选择。️ 常见坑与排查输出无限重复或不连贯检查temperature是否落在 0.5–0.7 区间推荐 0.6这是 README 中明确列出的首要注意事项。模型跳过思考部分问题下模型会直接输出空的think\n\n/think导致性能下降。按官方建议在每条输出前强制拼接think\n前缀。用 Transformers 加载主模型报错DeepSeek-R1 主模型尚未被 HF Transformers 直接支持不要硬试from_pretrained改用 DeepSeek-V3 仓库给出的 vLLM/SGLang 多卡部署方案。下载中断或分片缺失snapshot_download与git lfs均支持断点续传git 侧执行git lfs fetch --all补齐恢复后重跑上文的两条完整性校验命令确认 163 个分片与索引一致再开始部署。下一步建议先按方式二克隆仓库并用校验命令确认 163 个分片完整然后在你的目标机器上跑通 32B 蒸馏模型的 vLLM 服务验证 GPU 与显存余量是否满足后再上 671B 主模型。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表