
9 月 29 日DeepSeek 发布了 V3.2-Exp官方把它定位为一个实验性Experimental版本。这次发布有两个看点一是引入了新机制 DeepSeek Sparse AttentionDSA稀疏注意力二是API 价格同步下调官方称开发者调用成本降低 50% 以上。对做应用的人来说最直接的感受是账单便宜了但真正值得看一眼的是它把成本降下来的技术路径。这次核心变了什么从全连到挑着看要理解这次发布得先说清楚注意力机制的老问题。Transformer 里最耗算力的部分就是注意力序列里每个 token 都要和其他所有 token 算一遍关联复杂度是 O(n²)。序列一长算力和显存就是平方级往上涨——这也是为什么长文档、长对话、代码仓库级上下文一直又贵又慢。稀疏注意力Sparse Attention的思路很直白不再让每个 token 和全部 token 都算而是只计算其中一部分关联把无效或低价值的计算跳过去从而把长文本的代价压下来。这个思路在学术界并不新难的是怎么在大规模模型上真正落地并且不让效果掉下来。按官方说法DSA 首次实现了细粒度的稀疏注意力。为了验证引入稀疏注意力后有没有副作用DeepSeek 特意把 V3.2-Exp 的训练设置与上一版 V3.1-Terminus严格对齐结论是在各领域的公开评测集上V3.2-Exp 的表现与 V3.1-Terminus 基本持平。这一点很关键。没变的是模型能力——官方自己说公开评测基本持平它不是一个能力跃迁的版本变的是同等效果下的成本。另有社区资料据报道称长文本推理速度提升约 2–3 倍、显存占用下降约 30%–40%API 价格下调幅度超过 50%。这些数字来自第三方整理具体以官方和实测为准。换句话说这是一次降本而不是涨价的更新符合 DeepSeek 一贯的打法。对普通开发者意味着什么如果你在用大模型做产品这次更新的现实影响主要有三点长上下文场景最先受益。长文档问答、RAG 检索、代码理解、会议纪要这类喂进去的料特别多的应用单位成本下降最明显。调用方式不变。官方明确说访问方式没变API 版本已经是 V3.2-Exp也就是说老代码基本不用改。DeepSeek 的 API 兼容 OpenAI 的 SDK 格式fromopenaiimportOpenAI clientOpenAI(api_key你的 DeepSeek API Key,base_urlhttps://api.deepseek.com,)respclient.chat.completions.create(modeldeepseek-chat,messages[{role:system,content:你是一个严谨的助手。},{role:user,content:把下面这段长文档总结成要点……},],)print(resp.choices[0].message.content)3.**模型和算子都开源了。**V3.2-Exp 已在 Hugging Face 和魔搭ModelScope开源论文同步公开配套的 GPU 算子也开源了 TileLang 和 CUDA 两个版本。想自己部署或者做研究的可以直接拿来看。## 用的时候有几个坑要注意-**它是 Experimental 版本。**官方也说了公开评测过了但还要更多真实场景验证。上生产前建议自己压一轮别只看价格就切。--**官方留了对比接口。**为了方便 A/BDeepSeek 临时保留了一个 V3.1-Terminus 的访问入口改一下 base_url 就能切回上一版做对比价格和 V3.2-Exp 一样。这个接口有截止时间做测试要趁早。--**便宜不等于该用。**选模型最终还是要看你的任务评测。价格只是其中一栏延迟、稳定性、结构化输出、工具调用能力都得看。--**把缓存用起来。**长 prompt 里固定部分系统提示、参考资料如果是复用型的充分利用上下文缓存能把成本再压一层这和选哪个模型同样重要。## 一句话收尾这波降价的直接原因是模型服务成本下降而成本能下降是因为稀疏注意力这类工程优化真正落了地。对开发者来说好消息是能省钱更好的消息是省钱不是靠砍能力换来的。 模型越来越便宜之后你会更倾向于自己搭一套还是继续用 API评论区聊聊。