ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

哈基米又行了?Gemini 4 Argon 凭什么反超 GPT-6

哈基米又行了?Gemini 4 Argon 凭什么反超 GPT-6 9 月 30 日Google DeepMind 发布新前沿模型 Gemini 4 Argon。它最扎眼的不是名字而是两件事定价每百万输入 2 美元、输出 10 美元——和前一天 OpenAI 刚发的五分之一价GPT-6.1 Sol 完全对齐同时在官方基准表里Vals Index 以 68.9% 压过了 GPT-6 Astra63.1%和 Claude Opus 5.567.0%。我的判断前沿模型的战争正在从谁更聪明变成同一个价格谁把活儿干得更全。Google 这次用和 OpenAI 平价小模型相同的价卖一个基准上反超旗舰的模型——这不是巧合是定价锚点被打穿后的贴身肉搏。01 事件本末先给网络防御者用再慢慢开放时间线很紧凑9 月 30 日 Google DeepMind 官方博客发布 Gemini 4 Argon它没有立刻全量开放而是先通过 Fairwind Program 向一组受信任的网络防御者推出后续才逐步走向开发者、企业和消费者。Google 同时明确正在参与美国政府关于发布前模型访问的自愿流程在护栏上持续迭代。这是一个比 OpenAI 更谨慎的发布节奏先在最敏感的网络防御场景小范围验证再扩大访问。Argon 的定位是在复杂、长周期工作流里维持深度推理主打真实世界软件工程、法律、金融等企业知识工作以及网络安全防御。02 数据拆解价格、token、基准三笔账第一笔是价格。官方口径introductory price每百万输入 token 2 美元、每百万输出 token 10 美元缓存输入按输入价的 95% 折扣。把它和昨天 GPT-6.1 Sol 摆在一起——输入 2 美元、输出 10 美元、缓存折扣——数字几乎一模一样。这意味着两家已经在中端旗舰这个价位带上正面撞上。第二笔是输出长度。Argon 把输出 token 上限从此前的 64K 一口气提到 1M官方称之为业界领先。这直接关系到能不能在单次推理里生成几十万 token、一次性啃下长代码库或长文档。第三笔是基准要分清哪些赢了和哪些没赢。官方对比表里Argon 在 Vals Index68.9%、AutomationBench51.3%、Vals Finance Agent v265.4%、Harvey 法律 Agent19.6%、DeepSWE v1.177.9%、长上下文 GraphWalks128K 档 99.7%上领先 GPT-6 Astra 和 Claude但在 FrontierSWE v255.0% 对 Astra 65.5%、OSWorld-2.0 桌面操作69.2% 对 Astra 72.6%上反而落后。换句话说它赢在知识工作和软件 Agent不是全面碾压。03 多方观点是真反超还是挑了对自己有利的榜乐观方认为Vals Index、金融和法律 Agent 这些更贴近真实企业工作流的指标被 Argon 拉开说明 Google 在把模型用进复杂业务这件事上重新抢到了身位1M 输出和数千名员工内部先行使用也显示它不是纸面模型。冷静方则提醒基准表是官方自己挑的、自己测的而且在更难的 FrontierSWE 和桌面操作上 GPT-6 Astra 仍领先先给网络防御者用也意味着它还没经过大规模真实用户检验。两边都成立——Argon 赢下了它想赢的那部分战场但离全面最强还有差距。04 产业影响价格锚点被打穿开发者开始横向比价对开发者当 OpenAI 和 Google 的中端旗舰都落到输入 2 美元、输出 10 美元选模型的依据就从谁便宜变成在我的任务上谁强——金融、法律、长代码场景可以试 Argon难的系统级编码和桌面操作场景 GPT-6 Astra 仍占优。对企业1M 输出让一次喂入整个代码库、整个合同集成为可能长上下文从卖点变成标配但 Argon 目前只对受信任网络防御者开放普通团队要等逐步放开。对竞品Anthropic 的 Claude 在 Vals Index 上 67.0% 居中既没被拉开也没守住第一前沿模型三强在同一价位上重新排队价格战远没结束。05 独立判断三个判断其一$2 / $10 正在成为新的中端旗舰标准价——OpenAI 和 Google 不约而同说明这个价位是当前推理成本和商业空间的平衡点其二Argon 真正的信号不是全面第一而是长上下文 企业 Agent这条线被拉到 1M token未来半年各家都会被迫跟进其三官方基准永远挑自己赢的题判断模型别只看一张表要在自己的真实任务上跑一遍。06 对读者的意义对普通用户不用急着追新模型Argon 还要一段时间才面向消费者对开发者这两天连续两个同价模型发布是时候把你的工作负载按知识工作 / 系统编码 / 长文档分类分别测一遍哪家更划算对行业观察者前沿模型的竞争叙事正在从参数和榜单转向在具体工作流里谁更便宜、更长、更稳。昨天 OpenAI 用五分之一价追旗舰今天 Google 用同样的价反超旗舰。一个信号越来越清楚前沿模型的高价时代正在结束接下来是同一价位上的贴身肉搏。极简速览① OpenAI GPT-6.1 Sol 与 Ultrafast 高速档持续发酵成本比 GPT-6 Sol 低约 30%② OpenAI 常驻智能体 Dots 正式发布面向 Pro/Business/Enterprise③ Anthropic 推迟 IPO 至 11 月招股书细节曝光④ METR 发布前沿模型评估博客。
返回列表