DeepSeek V4-Flash 正式版上线:Agent 能力翻倍,多项指标碾压 Pro, DeepSeek 今天7月31日下午通过 API 文档发布日志宣布DeepSeek-V4-Flash 正式版 API 上线公测Agent 能力大幅增强基准测试数据全面碾压 V4-Pro-Preview。提升有多大直接看数据基准测试V4-Flash 0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8Terminal Bench 2.182.761.872.181.085.0NL2Repo54.239.438.548.969.7Cybergym76.738.752.7-83.1DeepSWE54.47.312.846.258.0Toolathlon-Verified70.349.755.959.976.2Agents Last Exam25.215.816.523.825.7AutomationBench25.110.812.812.927.2DSBench-FullStack68.737.041.861.871.6DSBench-Hard59.625.831.154.571.7几个值得关注的提升DeepSWE 从 7.3 → 54.4。预览版在这个 Agent 核心基准上几乎不可用正式版直接翻了 7 倍。这个指标衡量的是 AI 在真实软件工程任务中的自主修复能力。Cybergym 从 38.7 → 76.7。翻了一倍。Cybergym 是 Agent 在复杂交互环境中的任务完成能力测试76.7 已经逼近 Opus-4.8 的 83.1。DSBench 两档全部翻倍以上。FullStack 从 37.0 → 68.7Hard 从 25.8 → 59.6。这是内部全栈开发和 Coding Agent 难题测试集提升幅度说明后训练针对性很强。Terminal Bench 2.1 从 61.8 → 82.7。直接超过 V4-Pro Preview 的 72.1逼近 Opus-4.8 的 85.0。作为一个轻量级Flash模型这个成绩有点反常——不是 Flash 变强了是 Pro Preview 之前太弱了。怎么做到的DeepSeek 在文档里说了模型结构、尺寸和 Preview 保持一致仅重新进行了后训练。这意味着不是换架构而是把后训练阶段彻底重做了一遍。Preview 阶段的后训练大概率是赶工产物正式版用更充分的数据和方法重新训练了 Agent 能力。对 Codex 生态的适配正式版 V4-Flash 原生支持Responses API 格式并针对Codex进行了优化适配。这意味着 Codex 用户可以直接配置 V4-Flash 作为底层模型不需要额外做格式转换。响应式 API 格式是 OpenAI 在 GPT-5.6 系列引入的支持流式工具调用、结构化输出。DeepSeek 直接兼容这个格式说明他们在 API 层面的兼容策略没有变——继续做「OpenAI 兼容」的便宜替代。跟 V4-Pro 的关系注意两点本次只升级了 V4-Flash 的 API 接口V4-Pro API 和 APP/WEB 端模型未做更改V4-Pro 正式版将会尽快发布说明 V4-Pro 的正式版还没准备好。Flash 作为轻量级模型先跑通流程Pro 版本还在打磨。从测试数据看V4-Pro Preview 的很多指标已经被 Flash 正式版超过了Pro 正式版如果不出点什么狠活定位会有点尴尬。跟 Opus-4.8 的差距从整体来看V4-Flash 0731 在 9 项测试中赢了 0 项但也拉近了差距。Terminal Bench 2.1 从差 23 分缩小到差 2.3 分AutomationBench 从差 16 分缩小到差 2 分。但 DSBench-Hard 仍然是 59.6 vs 71.7差 12 分——复杂 Coding Agent 任务还是 Opus-4.8 的统治区。