
Gemini 4 Argon 实测100 万 token 输出的「做题家」到底能不能干活上一波热点我追完 Astra、Computer Use、RSI、MCP 之后还写过一篇中国大模型调用量第一。当时我留了个尾巴——前沿能力之争海外那几家始终是绕不开的参照系。结果话音没落谷歌就把新旗舰甩出来了Gemini 4 Argon。这篇我想做两件事一是把 Argon 这组分数拆开看清楚二是回答一个更实在的问题——它号称能单次输出 100 万 token、软件工程测试屠榜那它到底是真能干活还是又一个榜单做题家以及你能不能现在就上手。一、先看它是什么憋了大半年谷歌换了个新名字Gemini 4 Argon 是谷歌时隔数月推出的新一代前沿模型也是谷歌第一次在命名上不走 Pro 路线、改用 Argon 这个新代号。定位很明确面向复杂、长周期的任务主攻三个方向——长程软件工程、企业知识工作金融/法律/税务、网络安全防御。最能体现长周期这三个字的是它把单次输出上限从上一代的 6.4 万 token 直接拉到了 100 万 token。这个数字是行业里目前最激进的意味着它能一次性吃下一整个大型代码库、一份超长文档或者一条几十步的完整任务链中间不用人反复喂。这里我得提醒一句别把输出 100 万 token理解成免费变强。输出是按 token 计费的100 万输出 token 意味着一次长任务可能烧掉几十美元这在后面定价部分会细说。二、分数确实好看但要看它是怎么刷的先摆成绩单。官方给的数据里Argon 在几项关键基准上拿了第一基准Gemini 4 Argon主要对手DeepSWE v1.1长程软件工程77.9%第一Claude Opus 5.5 74.2%、GPT-6 Astra 74.1%Vals Index金融/编程/法律/税务68.9%第一Opus 5.5 67.0%、Astra 63.1%AutomationBench业务自动化51.3%第一Opus 5.5 42.5%、Astra 41.4%LVBench长视频理解91.7%第一—CWE-bench v1漏洞修复68%并列第一与 GPT-6 Astra 并列单看这张表Argon 几乎屠榜。但我要泼盆冷水——有几个关键项它并不领先在 FrontierSWE v2、Terminal-Bench终端操作这些更贴近真实干活的测试里它落后于 GPT-6 Astra 和 Claude Opus 5.5。这也是为什么钛媒体那篇直接给了个标题——“做题家”榜单成绩强实际干活差点意思。我的看法是这个批评戳中了一半。DeepSWE、AutomationBench 这类基准确实能反映长周期任务的能力Argon 在它们身上领先不是假的但真实干活比基准脏得多涉及终端交互、失败恢复、边界判断这些恰恰是它没跑赢的地方。所以更准确的说法是Argon 在长程代码这一项上确实是目前最强的但别把它当成全面碾压。三、100 万 token 输出真正的意义在哪我之前写 GLM-5.3-Flash 时说过一句话以前长上下文和便宜是互斥的。Argon 这次解决的是另一对矛盾——以前长任务和要人盯是绑定的。过去让模型做一个大重构它写到一半 token 就用完你得把上下文续上、再喂一遍模型容易在断点处跑偏。100 万输出上限配合它能一次性读入的大上下文本质是让模型能一口气把一条长链走到头不用中途被人打断。这对自动改代码—跑测试—再改—再跑这种循环尤其值钱。但代价是实打实的钱。下面这张定价表能让你直观感受一下首发价输入 $2 / 百万 token输出 $10 / 百万 token优惠期结束后会涨到 $4 / $20缓存输入有约 95% 的折扣这点对重复喂上下文的长任务很友好。换算一下一次吃满 100 万输出 token 的任务光输出就 $10优惠期到 $20常规。所以100 万 token是能力不是福利用之前先算清楚账单。四、最关键的一条你大概率现在用不上说句大实话这篇最该让你知道的是最后这条——Argon 目前不对普通用户开放。它首发走的是Fairwind 计划先优先提供给可信的网络安全专家、政府机构等并参与美国政府的自愿评估流程之后才逐步向付费 API 客户和 Google AI Ultra 用户开放。官方给出的理由就是安全——一个能修漏洞、能做长周期自动化、输出上限又拉到 100 万的模型红队和滥用风险都得先压住。所以对绝大多数开发者现在的状态是看得到成绩单摸不到 API。你暂时没法在本地或控制台里真跑一遍它。五、我的判断值得盯着但不用急着切综合下来我对 Argon 的判断是三句强是真的强长程软件工程这个方向上77.9% 的 DeepSWE 是实打实的领先100 万输出上限也确实是里程碑级别的变化但没到闭眼换终端操作、真实任务里的稳定性还没跑赢 Astra/Opus加上 Fairwind 限制短期内它的实际可用性被安全这一道闸门卡着对开发者的启示真正该关注的不是谷歌屠榜了而是**长周期任务 超长输出正在成为下一阶段的竞争主轴**。谁先把能一口气干完长活这件事做到又稳又便宜谁就赢了下一局。对普通开发者眼下能做的其实很朴素先别管 Argon把你手里的任务用现在能拿到的模型Astra、Opus、GLM-5.3跑通把长任务拆解的基本功练扎实。等 Argon 真正开放的那天你的任务链早就准备好了直接切上去试一版就行。小结Gemini 4 Argon 这篇三句话总结分数DeepSWE 77.9%、Vals 68.9%、AutomationBench 51.3% 多项第一但 FrontierSWE、Terminal-Bench 落后做题家的批评有几分道理能力单次输出 6.4 万 → 100 万 token核心是让模型一口气干完长活、不用人盯但输出按 token 计费长任务 几十美元门槛走 Fairwind 计划先给网络安全/政府机构普通开发者现在摸不到 API只能等逐步开放。下一篇预告谷歌在这边憋新旗舰国产模型在另一边悄没声地把 Cursor 打下来了。下一篇聊聊GLM-5.3 怎么进的 Cursor、CursorBench 开放权重第一是怎么回事以及中美 AI 差距缩到 3% 这个数字背后的产业逻辑。关注不迷路。本文观点为个人看法事实部分来自公开报道链接如下欢迎指正。谷歌反击Gemini 4 Argon 性能比肩 Astra成本仅 60%36氪谷歌推出了个做题家Gemini 4 Argon 屠榜但干活差点意思钛媒体谷歌最前沿 AI 模型 Gemini 4 Argon 登场长周期代码工程 DeepSWE 超 Claude Opus 5.5IT之家Google launches Gemini 4 Argon as its new frontier modelThe NewsGemini 4 Argon 追平 GPT-6 Astra但还用不上腾讯云开发者