DeepSeek 涨价 3 倍后换谁?5 款国产模型 API 成本实测:K3 贵 17 倍、GLM 贵 5 倍,只有它没涨 周一早上打开开发者后台DeepSeek 的弹窗公告还挂在那里「计划近期整体上调 API 服务定价预计涨幅较大」。群里有人连夜写起了多模型路由有人把 V4-Pro 的调用量降到了零。我盯着自己上个月的账单——一个月 4000 万 token 的调用量全压在 DeepSeek 上这一涨我的 SaaS 成本结构要重新算一遍。涨多少按照 5 月 25 日「永久降价」的 1/4 定价3 元/6 元反推如果恢复到原价12 元/24 元那就是 300% 的涨幅。知乎上 276 个回答、158 万浏览最高赞的说法是V4-Flash 性价比太炸7 月 31 日正式版上线后全球调用量把服务器「蹬冒烟了」峰谷定价根本削不动 agent 的负载——因为 coding agent 没有上下班时间跨时区 24 小时都在跑。于是问题变成DeepSeek 涨价后我该换谁我把这个问题做成了一次实测拿 5 款国产模型的官方定价页 第三方评测数据算了三笔账——同样的活各家收多少钱同样的钱各家干多少活以及换过去要改多少代码。先看总表5 款模型一张表看清格局先说清楚以下价格全部来自各家官方定价页2026 年 8 月 7 日逐条核对单位是元/百万 tokenDeepSeek 取平峰价工作日高峰 9:00-12:00、14:00-18:00 翻倍模型输入(缓存未命中)输入(缓存命中)输出相对 V4-Flash 输出价倍数DeepSeek V4-Flash10.0221xDeepSeek V4-Pro30.0256高峰 123x高峰 6xKimi K320210050xQwen3.7-Max12—3618xGLM-5.210—3115.5x看完这张表你大概明白知乎那 276 个回答在吵什么了——V4-Flash 的输出价是 K3 的五十分之一。注意K3 是 7 月 16 日刚开源的 2.8 万亿参数「全球最大开源模型」GLM-5.2 是智谱的旗舰Qwen3.7-Max 是阿里的旗舰它们都不是杂牌。差距不是「贵一点」是数量级。但这只是牌价。真正决定账单的还有三件事缓存折扣、峰谷定价、以及模型到底能不能干你的活。下面逐个拆。维度一单价拆解——输出价决定生死先算第一笔账纯输出成本。对 coding agent 来说输出 token 是账单的大头——一次代码生成任务输出可能占 60% 以上。同样的 100 万输出 token模型花费备注DeepSeek V4-Flash2 元平峰高峰 4 元DeepSeek V4-Pro6 元高峰 12 元平峰是 Flash 的 3 倍GLM-5.231 元Flash 的 15.5 倍Qwen3.7-Max36 元Flash 的 18 倍Kimi K3100 元Flash 的 50 倍我一个月的 agent 调用量大约 4000 万 token其中输出约 1500 万。全用 V4-Flash300 元/月全用 K315000 元/月。这个差价不是「优化一下」能抹平的。有人会反驳K3 开源、能本地部署不能这么比。对但本地部署 2.8 万亿参数模型需要的显存比绝大多数小团队的月 API 账单贵两个数量级——这个话题我在 K3 踩坑实录里算过这里不展开。维度二能力拆解——便宜的不只是「够用」是「更好用」价格差 50 倍如果便宜的那个是残废那贵得有道理。但 2026 年 8 月的诡异之处在于最便宜的 V4-Flash 正式版能力反而超过了自家 Pro 预览版。看三组第三方数据Artificial Analysis 智能指数独立第三方统一测试集2026-07-31 发布当天入榜模型智能指数备注Kimi K357开源榜第一GLM-5.251—GPT-5.6 Luna51OpenAI 最便宜款DeepSeek V4-Flash (0731)50比自家 V4-Pro 预览版高 6 分DeepSeek V4-Pro 预览版44—Terminal Bench 2.1真实终端环境实操改配置、跑脚本、修 bugV4-Flash 正式版82.7 分官方称「远超 V4-Pro 预览版」。OpenCode 平台 8 月 5 日调用数据单日 7.5T tokenV4-Flash 独占 6.3T占比84%。开发者用脚投票的结果是便宜 能力在线 断档领先。更有意思的是技术细节V4-Flash 正式版和预览版结构、尺寸一模一样284B 总参/13B 激活只重做了后训练就把 Agent 能力拉到了 Pro 之上。同一个发动机重新调校变速箱加速直接快一档。这说明 Flash 之前压根没摸到自己的上限。但 Flash 有明确短板实测中我发现两点一是不支持视觉输入二是世界知识「稍逊一筹」——API 文档、库行为这类事实性问题官方自己都建议人工复核。我的用法是跑量任务全给 Flash卡壳的难题切旗舰。维度三缓存折扣——agent 时代真正的省钱密码这是最容易被忽略、但对 agent 负载影响最大的一格。agent 每次调用都要重发整个代码库、系统提示词、历史轨迹——重复输入在 agent 场景占比能到 80% 以上。所以「缓存命中价」才是 agent 账单的主战场。模型未命中输入命中输入命中价/未命中价GPT-5.6 Sol$5$0.510%Claude Opus 5$5$0.510%Gemini 3.1 Pro$2$0.210%DeepSeek V4-Flash1 元0.02 元2%DeepSeek V4-Pro3 元0.025 元0.83%美国三家厂商的缓存折扣整齐划一都是「一折」DeepSeek 打到 0.83 折。原因在架构别人的 prompt cache 放在显存里每 GB 几十美元的 HBMDeepSeek 把压缩后的注意力条目直接落盘每 GB 几毛钱。同样是 100 万 token 重复上下文Claude Opus 5 收 $0.5V4-Pro 收 0.025 元——差 138 倍。这一格对 agent 开发者意味着什么意味着换模型的迁移收益缓存命中价才是大头。我自己测过一个 50 万 token 系统提示词的 agent切到 DeepSeek 后账单掉了两个数量级主要就掉在这一格。维度四峰谷定价与迁移成本——「换谁」的最后两块拼图峰谷定价DeepSeek 工作日 9:00-12:00、14:00-18:00 翻倍。知乎高赞说得对——削峰对网页/App 有用对 coding agent 基本没用因为 agent 可以批式、异步、跨时区跑。但对国内团队有个实际影响把重任务挪到非高峰时段成本直接减半。我现在的做法是给 agent 加一个调度层# 简单的高峰规避高峰时段走 Flash 平峰缓存非高峰才放行 Profromdatetimeimportdatetimedefis_peak_hour(dt:datetime)-bool:DeepSeek 高峰时段: 工作日 9-12, 14-18 (北京时间)ifdt.weekday()5:# 周末returnFalsereturn(9dt.hour12)or(14dt.hour18)defroute(model:str)-str:ifmodeldeepseek-v4-proandis_peak_hour(datetime.now()):returndeepseek-v4-flash# 高峰降级到 Flash成本减半returnmodel迁移成本这是「换谁」决策里经常被高估的一环。实测发现国产模型几乎都兼容 OpenAI 格式切换通常是改一个 model 参数的事# 从 DeepSeek 切到 Qwen3.7-Max只改 base_url modelfromopenaiimportOpenAI clientOpenAI(api_key你的key,base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1,# 阿里云百炼)respclient.chat.completions.create(modelqwen3.7-max,# 原来是 deepseek-v4-promessages[{role:user,content:帮我 review 这段代码}],)DeepSeek 官方还原生支持 OpenAI 的 Responses API 格式并且针对性适配了 Codex——不用改 Base URL 就能切模型。也就是说如果只是想在 DeepSeek 涨价期保留一个备胎切换成本几乎为零完全可以做多模型路由便宜任务走 Flash难题走旗舰哪家便宜切哪家。选型建议按场景对号入座跑量型 agent代码生成、批量任务、RAG 管道→ DeepSeek V4-Flash输出 2 元/百万 token 缓存命中 0.02 元这个价位没有对手。V4-Flash 正式版的 Agent 能力Terminal Bench 82.7、AA 指数 50已经证明它不是「廉价替代品」而是「性价比主力」。我的 SaaS 已经 90% 流量切到 Flash账单降了 60%。复杂推理 / 高难度任务 → V4-Pro 平峰 高峰规避V4-Pro 平峰输出 6 元比 K3100 元、Qwen3.7-Max36 元、GLM-5.231 元都便宜配合上面的高峰规避调度成本可控。等 V4-Pro 正式版发布官方已预告「尽快」能力还会有一波提升。需要视觉 / 多模态 → 别选 Flash看 GLM-5.2 或 Qwen3.7-MaxFlash 不支持视觉输入是硬伤。多模态场景 GLM-5.2AA 指数 51和 Qwen3.7-Max 是更合适的选择价格虽然贵 15-18 倍但这类任务量通常不大。有合规/数据隔离要求 → Kimi K3 本地部署K3 是唯一「全面开源可自部署」的旗舰输出 100 元/百万 token 的 API 价其实是在劝你自己部署。适合数据不能出内网的企业场景成本模型完全不同显存一次性投入换长期边际成本。趋势观察涨价不是 DeepSeek 一家的事最后说三个趋势比「换谁」更重要国产模型的「白菜价」时代正在收尾。腾讯云一个月内两次涨价智谱多次提价现在轮到 DeepSeek。8 月 6 日的公告本质上是整个行业从「低价抢市场」转向「合理定价」的信号。开发者要习惯 API 价格是波动的而不是只降不升。便宜的模型越来越能打旗舰的护城河在变窄。V4-Flash 用 13B 激活参数反超自家 Pro 预览版K3 开源登顶调用榜——「参数越大越强」的直觉在 2026 年已经失效后训练和架构的效率才是分水岭。缓存命中价将成为下一轮竞争焦点。agent 时代 80% 的输入是重复的谁把重复输入的边际成本打到最低谁就拿到 agent 开发者的长期账单。DeepSeek 的磁盘 KV 缓存已经把这一格打到 0.83 折这个技术路线值得关注——下半年昇腾 950 超节点上市后Pro 价格还有下调空间官方定价页已明示。我的结论是先别急着「换」先学会「路由」。把 Flash 当主力、Pro 当攻坚、高峰规避当默认配置这个组合在涨价落地前仍然是最优解。真到涨到不能忍的那天切换成本已经提前铺好了。延伸阅读AI编程工具从狂欢到清醒Cursor和Claude Code混用3个月烧了多少、GPT-5.6 降价 80% 后踩坑实录Fast 模式 2 倍价、Claude Opus 5 半价实测3 个真实任务追平 Fable 5系列文章DeepSeek API宣布整体涨价开发者现在该做什么DeepSeek 涨价落地我用开源 Headroom 把 Token 成本砍掉 92%Qwen3.8-Max 接入踩坑实录3 个隐蔽坑让成本翻 3 倍测了 5 款工具才发现差距这么大。关注我 第一时间获取更多 AI 工具深度横评。