ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

75.2% 掉到 71.9%:把推理档位调高一档,模型分数为什么反而更低?

75.2% 掉到 71.9%:把推理档位调高一档,模型分数为什么反而更低? 75.2% 掉到 71.9%把推理档位调高一档模型分数为什么反而更低DevDay 直播里最抓人的一句话是「接近 Astra 的智能只要五分之一的价格」。GPT-6.1 Sol 当天上线Hacker News 的讨论帖 很快堆到九百多分、八百多条评论。但让不少开发者真正停下滚动的不是价格是公告页底部那张基准表里的一格。反直觉的那一格一位开发者在讨论帖里问了个很朴素的问题为什么同一个模型推理档位从 High 提到 XHigh分数反而更低他看的是 DeepSWE 那一列GPT-6.1 Sol 在 High 档位是 75.2%切到 XHigh 之后是 71.9%。档位更高、思考的 token 更多、账单更贵分数却掉了三个百分点。他的第二个问题其实更关键这个数字是跑一次得到的还是多次取平均按直觉这事不该发生。推理预算给得越多模型该把题想得越透。可现实里的分数曲线并不总是单调的。先把「档位」这个词说清楚在这类 API 里档位reasoning effort控制的不是换哪个模型而是一次推理里允许模型花多少预算能生成多长的内部思考过程能不能中途回头改策略。它不是「换了个更聪明的脑子」而是「同一个脑子允许它想多久」。而测试时计算test-time compute的收益是递减的。这条经验在数学和代码这类有明确中间步骤的任务上最明显预算翻倍分数会涨但涨得越来越少再往上加边际收益可能直接变成负数。原因不神秘。多出来的思考预算不一定用在「想得更深」也可能是用在「更啰嗦地重复已经想通的部分」。解释一几个百分点的差异可能只是噪声第一个怀疑对象是评测本身。那位开发者的第二个问题——跑一次还是取平均——正好戳在大多数基准表的软肋上。公告页很少写清楚每个条件跑了几次、是 pass1 还是多轮取最优、温度设成多少。如果每个条件只跑一次几个百分点的差距很可能落在随机噪声里不一定代表能力差异。评估一个大模型在小数据集上的单次表现本身就有不小的方差。把一次运行的结果当作「能力差三档」是把噪声读成了信号。解释二想太多把对的改成了错的第二个解释有正经论文撑着。一类研究把这种现象叫做「过思考」overthinking。arXiv:2412.21187 的标题起得很直白——《Do NOT Think That Much for 23?》它指出 o1 这类长思考模型在简单题上也会展开一大段重复验证结果反而更容易答错想得越久越有机会在自我怀疑里把本来正确的答案改掉。顺着这条线往下还有专门给思考过程「设预算」的工作。s1: Simple test-time scaling 提出的做法是强行给推理过程加上长度上限配合少量高质量样本做微调能在降低成本的同时保住准确率。它传达的意思很明确思考长度不是越长越好而是存在一个合适的点。这两个结论放在一起就解释了为什么分数曲线会在某个档位之后掉头模型不是不够努力而是把预算花在了重复和自我纠缠上。解释三在 Agent 环路里档位高不一定是好事第三种可能跟使用姿势有关。单轮基准测试里模型答完就结束。但在 Agent 环路里高 effort 的模型更倾向于「多做一步」多调一次工具、多改一版实现、多补一次验证。单看某一步它可能更谨慎可一旦放进循环多出来的那一步就是新的失败点——多一次工具调用就多一次参数拼错的机会多改一版代码就多一次引入回归的机会。这也是为什么 HN 上同一条帖子里实验数据和个人体感会打架有人在独立基准上测出它几乎追平 Astra、价格还只有五分之一也有人坚持它在编码上仍然不如 Opus 5.5。两者的观测口径根本不同。一周一发当模型发布变成持续集成比这张表更值得注意的其实是节奏。Sol 6 上线到今天才过了六天。讨论帖里有人把这件事总结成一句话这基本上已经是模型发布的持续集成。上一代模型在自己的生态位里还没捂热下一代就来了——这让「读最新那张表」这件事的价值本身就在贬值。而这次公告里真正的主角很可能不是模型本身而是缓存价格每百万 token 的缓存输入只要 $0.10比标准输入价格低 95%比上一代 Sol 的缓存价再低 50%。对 Codex 这类反复读同一份代码库、同一段对话历史的产品缓存价的降幅比标称的「五分之一」更能决定月度账单。发布会上另一个容易被忽略的细节是 Ultrafast最高 300 token/s、约 8 倍速度代价是 6 倍价格——它换来的是交互体验不是能力。顺带一提订阅侧的调整也很有意思更高一档的月付套餐上线同时原有 $200 套餐在 Codex 里的可用额度被减半、ChatGPT 里的周消息上限也砍了一半。同一个模型价格表在涨、token 单价在跌——这两件事同时发生正好说明「谁更便宜」这个问题已经取决于你按什么口径算。与其读表格不如自己跑几道题对每天要用它干活的人来说一张官方基准表的解释力正在下降。社区里已经有一批更贴近实际场景的独立评测在跟进有人用自建基准把新模型和高一档的老模型放在一起比通过率和价格有人在专门的对比页上逐档位记录分数也有人干脆只信那些公开了原始提示词和运行脚本的个人测试。如果要在多个模型、多个推理档位之间做横向对比像 likeai520.cc 这类 API 中转可以省掉一部分逐家接入和验证的工作。一个判断那张表真正告诉我们的不是「XHigh 更差」而是「档位和分数之间不存在一条普适的单调曲线」。对做产品的人来说这意味着两件事第一别把公告页上几个百分点的差距当成能力差距先看它有没有跑够次数第二选档位应该以自己手上的任务集为准——同一个任务集把 Low、Medium、High 都跑一遍画一条自己的成本/通过率曲线通常比读任何一张公开表都准。模型发布已经变成持续集成那么评测也该变成持续集成不是等下一代出来重读一次表而是把一小撮固定任务常驻在自己的流水线里每次模型更新就重跑一遍。分数会变任务集不变这样才有比较的意义。主要参考GPT-6.1 Sol 发布公告、Hacker News 讨论帖id49896586、Simon Willison 的 DevDay 2026 现场记录、Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war、arXiv:2412.21187、arXiv:2501.19393
返回列表