
每周一问 | 参数没变、价格没涨Qwen 3.8 Max 的代码能力凭什么一个月暴涨近 3 倍「每周一问」是一个固定栏目每周锁定一个 AI 领域的热门事件抛出一个值得深挖的问题再给出一篇尽量通俗、但足够专业的解答。不求面面俱到只求把一个问题讲透。〇、本周 AI 圈速览2026.08.31 – 09.06先看这一周都发生了什么9 月 2 日阿里千问发布Qwen 3.8 Max-0902代码能力一个月内大幅跳涨在 Code Arena WebDev 类目以1691 分登顶超越 Claude Opus 5API 价格维持输入 $2 / 输出 $6 每百万 tokens不变OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 / Mythos 5.1、Google 的 Gemini 3.8 Flash、Meta 的 Muse Spark 1.3 相继亮相——大模型正式进入**周更节奏**DeepSeek 在DeepSeek 时刻一年多之后放出了V4 预览版再次引发市场关注。一、本期问题先用一张图看清这次发布到底暴涨了多少数据摘要0902 版 vs 上一版本基准测试上一版本0902 版变化考察什么TerminalBench 3.011.329.0157%真实终端环境中的智能体任务DeepSWE 1.156.669.322%真实仓库级的 SWE 修复任务Code Arena WebDev—1691 分全球第一登顶真人用户盲测投票的人类偏好问题来了从官方口径看0902 是同一 Max 系列基座上的月度后训练post-training更新基座没换、上下文窗口还是 1M、API 价格一分没涨。那么——这多出来的代码能力到底是从哪里冒出来的一个月涨 157%是模型突然变聪明了还是另有原因这个问题背后其实藏着大模型领域一个核心认知问题模型的能力到底是由预训练决定的还是由后训练决定的下面我们逐层拆开。二、TL;DR先给结论赶时间的朋友看这三句话能力的原材料早就备齐了。预训练阶段模型已经读过海量代码知识与推理潜质都藏在参数里只是没有被唤醒后训练改变的是行为策略。0902 版的跃升主要来自官方所说的 Coding 与 Cowork 方向的后训练——尤其是代码强化学习和智能体Agentic训练它们教会模型把潜质稳定地用在正确的场景上11.3 → 29.0 本质是从没练过到练过的跨越。TerminalBench 考察的是在真实终端里干活的智能体能力上一版本在这块几乎空白补上一整块能力栈分数自然呈现爆炸式增长——这是补短板不是智力跃迁。三、详解能力到底从哪里来3.1 先破除一个误解后训练不是往模型里塞新知识很多人下意识认为模型能力提升 学了新东西。但对于同基座的版本更新来说更准确的理解是——预训练决定上限后训练决定你能调用多少上限。打个比方一个大学生大一到大四的教材预训练语料早就读完了。考前一个月开始刷题、模考、总结错题后训练期末成绩从 70 分提到 90 分——他并没有突然变聪明而是学会了**“在考试这个特定场景下正确调用已有知识”**。学术界给这个现象起过一个名字elicitation能力激发。当然也有研究认为强化学习RL后训练确实能让模型学到新的组合泛化能力——激发派与学习派之争至今没有完全定论。但业界已有共识对于代码这类可验证任务RL 后训练的激发效率极高。这正是 Qwen 3.8 Max-0902 这类月更版本的技术底座。3.2 后训练流水线代码能力的四个台阶一张图看清现代大模型的代码能力是怎么一层层练出来的台阶 1预训练 —— 决定上限用数万亿 token 的代码 文本做下一个词预测。模型在这个阶段学到的不是怎么写代码而是语言、逻辑与代码世界的统计规律。此时它像一个博览群书但从没参加过考试的学生能力以潜质的形式存在但不知道何时使用、如何使用。台阶 2监督微调SFT—— 教会怎么说话用高质量的人工标注指令 → 回答数据微调。这一步主要是教会模型对话格式与人类表达习惯理解需求、给出结构化回答、该用代码块时用代码块。台阶 3可验证奖励强化学习RLVR—— 教会写对代码传统 RLHF 依赖人类标注偏好贵、慢、主观。而代码任务天然自带标准答案于是出现了RLVRRL with Verifiable Rewards——让机器自动当裁判# 一个极简的 RLVR 奖励函数示意伪代码defreward(response,task):codeextract_code(response)# 从回答中抽取代码try:ifnotcompiles(code):# ① 能编译吗return0.0ifnotpasses_unit_tests(code,task.tests):# ② 单元测试过吗return0.2ifrun(code)task.expected_output:# ③ 运行结果对吗return1.0return0.4exceptTimeoutError:# ④ 死循环 / 超时return0.0奖励完全客观、可自动化、可大规模并行模型对同一道题生成成百上千个解法机器自动打分强化学习算法把高分行为的概率推高、低分行为的概率压低。没有人类标注的瓶颈训练规模可以想开多大开多大。台阶 4智能体强化学习Agentic RL—— 教会把活干完这是0902 版的主要发力点也是这两年行业竞争的主战场。单轮给题写码和在真实工程环境里完成任务完全是两回事。Agentic 训练的做法是把模型扔进沙箱环境给它一个终端、一个仓库、一个任务例如修复这个 failing test让它多轮自主操作读文件 → 写代码 → 跑测试 → 读报错 → 定位问题 → 修改 → 再跑不看中间过程只按最终任务完成度给奖励。这训练的是长链条行为策略什么时候该探索、什么时候该止损、报错之后先查什么、上下文里哪些信息值得记下来。TerminalBench 考察的正是这种能力——它模拟的是开发者日常真正的样子不是在聊天框里问代码而是在终端里让 AI 替你把整件事干完。3.3 为什么偏偏是 TerminalBench 涨得最猛先分清三类基准的定位基准类型代表考察什么特点静态代码基准HumanEval / MBPP 类单函数补全早年主流如今普遍饱和易受数据污染影响环境交互基准TerminalBench、DeepSWE真实环境中的多轮智能体任务贴近真实工作方差大、难度高人类偏好竞技场Code Arena WebDev真人用户盲测投票反映好不好用而非对不对现在就能解释那个反差了TerminalBench 11.3 → 29.0157%11.3 的基线说明上一版本基本没有专门训练过终端智能体场景——不是模型笨是没练过这个题型。0902 版把这块能力栈专门补上分数自然跳涨。DeepSWE 56.6 → 69.322%上一版本已经有不错的 SWE 底子边际提升自然难得多。这符合机器学习的普遍规律从 0 分到 60 分容易从 85 分到 95 分难。所以以后再看到XX 模型暴涨 N 倍的新闻先问两个问题涨的是哪个基准基线是多少基线越低、任务越新暴涨越常见。3.4 Code Arena WebDev 1691 分登顶人类偏好竞技场意味着什么Code Arena 采用类 Elo 机制真人用户盲测两个模型的真实 Web 开发产出投票分高下。它的价值在于✅ 贴近真实使用体验刷榜难度大✅ 综合考察代码正确性、页面美观度、交互细节等真实开发者在意的东西⚠️ 但要注意偏好 ≠ 正确性用户可能投给更好看的前端而不是更正确的逻辑Elo 分数存在置信区间第一名与第二名可能差距很小。1691 分超越 Claude Opus 5意味着国产模型在用户实际觉得好用这个维度上已经具备了与顶级闭源模型正面掰手腕的实力——这在一年前还难以想象。3.5 为什么价格可以一分不涨很多人好奇能力涨这么多为什么 API 价格不变拆开成本结构就明白了环节算力量级成本性质是否影响 API 定价预训练极大万卡集群 · 月级厂商一次性重资产投入间接长期摊销后训练RL中比预训练低 1~2 个数量级厂商迭代投入基本不影响推理单次请求用户按 token 付费直接决定推理成本由参数规模、架构效率、KV cache 优化决定——0902 版这些都没变所以 $2/$6 不需要变。这也是同基座月更版本策略的商业逻辑基座是重资产后训练是轻资产。基座打磨一次后训练可以按月快速迭代版本更新又快又便宜还能持续制造话题——一鱼多吃。3.6 冷静看待三个注意事项基准分数 ≠ 你的实际体验。评测集存在污染与过拟合风险榜单上领先两三分与你的实际代码质量没有必然联系。最可靠的做法永远是拿你自己的仓库、自己的任务做小规模盲测。暴涨要看绝对值。11.3 → 29.0 很震撼但按满分 100 计29.0 依然意味着约七成任务搞不定。智能体编程这个领域所有人都还在爬坡。周更时代的选型焦虑是真实的。与其每周追榜单第一不如建立自己的评测集把选模型从玄学变成可复现的工程流程。四、对开发者的三点启示建立自己的 eval。维护 20~50 个来自真实业务的测试任务最好带可自动验证的结果每次模型更新跑一遍。自己的数据永远比榜单可信这已经是很多团队的标准实践。关注 agentic 能力而非单纯的代码生成。2026 年编程模型的竞争焦点已经从写对一个函数转移到在终端里把整个任务干完。模型与编码智能体工具链Claude Code、Cline 等 CLI / IDE 工具的适配质量会成为越来越重要的选型维度。性价比窗口是真实的。第一梯队的代码能力 $2/$6 的价格 1M 上下文对个人开发者和中小团队来说是当下实实在在的红利期值得动手试一试。五、一句话总结模型的能力上限在预训练时就已注定但你能实际用到多少取决于后训练把它解锁到什么程度。Qwen 3.8 Max-0902 的暴涨不是魔法而是基座潜质 可验证奖励的代码强化学习 智能体训练三件事叠加的结果。这也预示着未来一年大模型竞争的主战场从堆参数转向练后训练。