
发布日期2026-10-01Gemini 4 Argon 是谷歌 DeepMind 于 2026 年 9 月 30 日发布的新一代旗舰大模型由 Google DeepMind 高级副总裁兼首席 AI 架构师 Koray Kavukcuoglu 撰文介绍距上一代旗舰 Gemini 3 系列已近 10 个月。官方将其定位为面向真实世界软件工程、法律与金融等企业知识工作、以及网络安全防御的前沿智能新阶段模型在长周期软件工程基准 DeepSWE v1.1 上拿到 77.9% 刷新纪录输出 Token 上限从 6.4 万提升到百万级定价为每百万输入 Token 2 美元、输出 10 美元推广期价格。不过这款模型目前并未全面公开而是先通过 Fairwind Program 提供给受信任的网络安全防御方待安全防护进一步加固后才会开放给付费 API 客户和 Google AI Ultra 订阅者。本文梳理 Gemini 4 Argon 的真实定价、跑分表现、落地案例和访问限制原因。Gemini 4 Argon 是什么谷歌沉寂近 10 个月后的旗舰回应谷歌官方博客用一句话概括 Gemini 4 Argon 的定位“在真实世界软件工程、法律与金融等企业知识工作以及网络安全防御这些复杂工作流中交付前沿级别的性能表现。”CEO Sundar Pichai 也在社交媒体上宣布了这一消息强调该模型在复杂工作流、网络安全防御和软件工程方面展现出前沿水平的性能。官方把 Gemini 4 Argon 的核心能力总结为三类场景真实世界软件工程从日常调试到大规模代码库迁移、算法设计企业知识工作金融、法律、税务等领域的多步骤深度推理网络安全防御自主发现、验证并修复关键软件漏洞。模型特性上为了支撑更长、更复杂的任务谷歌将 Gemini 4 Argon 的输出 Token 上限从上一代的 6.4 万大幅提升至行业领先的 100 万官方说明这让模型有足够的思考空间可以在单次推理轨迹中生成数十万 Token一次性解决复杂问题而不是输出上限层面的输入上下文窗口。跑分到底怎么样软件工程、金融法律、网络安全均有具体数据谷歌官方公布的跑分数据集中在三个方向基准测试领域Gemini 4 Argon 得分DeepSWE v1.1真实世界长周期软件工程77.9%刷新纪录AutomationBenchZapier核心商业流程端到端执行51.3%排名第一LVBench长视频理解91.7%最先进水平CWE-bench v1安全漏洞修复能力68%并列第一此外谷歌表示 Gemini 4 Argon 在 Vals Index按美国 GDP 贡献权重衡量金融、编程、法律、税务领域经济影响力的综合基准上排名领先在 Vals Finance Agent v2多步骤金融研究和 Harvey 的 Legal Agent Benchmark法律研究与撰写等垂直基准上同样表现突出。需要说明的是谷歌给出的基准数据集中在知识工作、长视频理解和网络安全这些方向纯编程类基准的具体对比数据相对有限实际编程场景下的表现还需要开发者结合自身任务进一步验证。定价推广期打五折缓存输入省 95%Gemini 4 Argon 的定价分推广期和常规期两档维度推广期价格推广期结束后输入价格每百万 Token2 美元4 美元输出价格每百万 Token10 美元20 美元缓存输入折扣较普通输入低 95%—输出上限约 100 万 Token约 100 万 Token谷歌官方注明推广期价格仅在限定窗口内有效到期后将按常规价格计费开发者如果计划长期接入需要提前规划好成本预算不能默认推广价一直有效。谷歌内部怎么用量子优化、内存优化、80 万行代码迁移谷歌披露了三个具体的内部落地案例用来说明 Gemini 4 Argon 在真实工程场景中的实际效果量子算法优化Argon 协助量子计算研究团队优化子程序的时空资源消耗qubit 数 × 门操作数其中一个案例在几分钟内把已发表的基线结果提升了 40%内存效率优化一组 Argon 智能体分析了谷歌全量数据中心的性能剖析遥测数据自主识别并应用内存优化方案已释放超过 300 TiB 内存预计全面推广后总计可节省 500 TiB 到 1 PiB大规模代码库迁移Argon 智能体正在把谷歌内部 C/C 代码库迁移到 Rust覆盖范围从 re2、libgav1 等数万行规模的核心库到 Fuchsia 操作系统 Zircon 内核的 80 万行以上代码由于涉及系统关键性这类大规模重写在上线前要经过严格的自动化与人工审计、模拟测试和评审。其中 libgav1谷歌的开源视频解码器是一个具体例子Argon 智能体接手了此前已有的 Rust 移植版本通过多轮性能剖析实验、研究编译器输出重写了 3.2 万行 SIMD 代码并写成能被编译器自动向量化的安全 Rust 代码最终得到的内存安全视频解码器运行速度比原 Rust 移植版快 2.7 倍视频输出结果完全一致性能已经接近经过优化的 C 版本。网络安全防御无防护栏开放给可信防御方谷歌把网络安全防御作为 Gemini 4 Argon 的重点能力之一模型可以自主发现、验证并修复关键软件漏洞。针对受信任的防御方和谷歌内部团队官方表示会不带网络安全防护栏地开放 Argon让他们能完整使用其前沿级别的网络安全防御能力。安全公司 Wiz 已经通过旗下Scan for Good计划免费为医疗、公共基础设施等关键系统查找并修复高风险漏洞使用 Argon一次早期演示中Argon 发现了此前多款前沿模型都未能识别的严重漏洞——涉及全球医院使用的医疗软件中暴露的敏感个人信息。为什么普通用户还用不了先给防御方再逐步扩大开放Gemini 4 Argon 没有出现在普通用户的 Gemini 界面里。谷歌采用分阶段发布策略第一批通过名为 Fairwind Program 的受控早期访问计划提供给受信任的网络安全防御方同时谷歌也在积极参与美国政府的自愿预发布模型访问流程。谷歌给出的理由是在公开发布前要先在防范滥用、抵御提示注入攻击、监控模型异常行为、强化测试环境这四个方向加固安全防护。其中监控机制值得关注——官方表示会持续追踪模型的思维链和具体行动一旦发现模型偏离用户本意、试图用超出预期范围的方式完成任务就会在必要时终止其执行。等早期测试者的真实反馈帮助团队进一步强化系统后才会按付费 API 客户和 Google AI Ultra 订阅者优先的顺序逐步扩大到更广泛的开发者、企业和消费者群体。常见问题QGemini 4 Argon 现在能直接用吗目前不能。它只通过 Fairwind Program 向受信任的网络安全防御方和参与美国政府预发布流程的机构开放普通开发者和企业用户需要等待后续开放阶段官方表示会从付费 API 客户和 Google AI Ultra 订阅者开始逐步扩大范围暂无公开的具体时间表。QGemini 4 Argon 最拿得出手的能力是什么从谷歌公布的数据看三个方向最突出长周期软件工程DeepSWE v1.1 得分 77.9%刷新纪录、商业流程自动化执行AutomationBench 排名第一、网络安全漏洞修复CWE-bench v1 并列第一。知识工作类任务整体表现强势纯编程基准的具体对比数据相对有限。QGemini 4 Argon 的价格贵不贵分推广期和常规期推广期每百万输入 Token 2 美元、输出 10 美元缓存输入可再省 95%推广期结束后价格会上调到每百万输入 4 美元、输出 20 美元开发者做长期成本规划时需要把这个变化考虑进去。Q想低成本横向对比 Gemini 系列和其他主流大模型有什么办法如果只是想体验和对比多款大模型在同一任务下的表现不涉及申请 Fairwind 这类受限早期访问类似七牛云 AI 大模型广场这类支持多模型统一接入、同屏对比的平台可以作为更轻量的横向测试起点。结语Gemini 4 Argon 的发布更像是谷歌迟到但有分量的一次回应长周期软件工程跑分刷新纪录内部已经用它优化量子算法、释放数百 TiB 内存、推进 80 万行代码迁移但谷歌主动选择了先把它交给网络安全防御方这类守门人再按付费客户优先的顺序逐步扩大开放范围这背后既是对模型安全风险的审慎考量也是当前前沿模型竞争节奏加快之下的一次权衡。本文内容以谷歌官方博客发布信息为准具体开放时间、定价和功能范围请以 Google 官方页面实时展示为准。参考资料谷歌官方博客 Gemini 4 Argon 发布文章blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon七牛云 AI 大模型广场qiniu.com/ai/models