Google 发布三款新模型,网友差评不断,Gemini 4 预训练能否力挽狂澜? 网友调侃与 Google 新模型发布据悉最近网友调侃称若从去年就开始用 Gemini感觉就像看着自家兄弟慢慢得了阿尔茨海默症。按理说公司发新模型通常会打脸此类调侃但刚刚 Google 一口气发布三个新模型后网友不仅没收回调侃反而笑得更大声。三个新模型分别是 3.6 Flash、3.5 Flash-Lite 和专搞网络安全的 3.5 Flash Cyber。官方博客措辞常见称其「更高效」「更聪明」「为大规模 AI agent 而生」然而实际体感却大相径庭。3.6 Flash主力模型的优势3.6 Flash 是此次的头牌官方定位为「主力」workhorse干活模型。3.5 Flash 于今年 5 月 I/O 大会发布此次是小版本迭代最大卖点是省 token。据 Artificial Analysis Index 数据3.6 Flash 比 3.5 Flash 少用 17% 的输出 token在 DeepSWE 等场景能省到 65%。官方还表示它跑多步任务时推理步数和工具调用更少即干同样的活废话、绕路更少账单更薄。其价格也下降了输入 1.5 美元/百万 token输出 7.5 美元/百万 token而上一代 3.5 Flash 输出为 9 美元。在基准测试方面官方给出了一系列数据。代码能力是重点DeepSWE 从 37% 提升到 49%官方称多余代码改动更少、执行循环更短生成代码更贴近生产环境要求机器学习研究方向的 MLE Bench 提升更明显从 49.7% 拉到 63.9%。计算机操作能力也有长进OSWorld-Verified 从 78.4% 升到 83%且「计算机操作」成了 Gemini API 和企业版的内置工具。知识工作方面GDPval-AA v2 从 1349 涨到 1421Hebbia、Harvey 等客户反馈它在文档解析等多模态任务上表现突出Figma、JetBrains 也出面背书。此外知识截止日期从 2025 年 1 月推进到 2026 年 3 月。安全方面3.6 Flash 采用升级版的 Frontier Safety 防护重点防范 CBRN 和网络攻击两类滥用抗越狱能力更强且尽量不误伤正常需求。3.5 Flash-Lite快且便宜的选择3.5 Flash-Lite 定位比 3.6 Flash 低一档主打「快」和「便宜」适用于高吞吐、低延迟任务如 agent 搜索、文档处理。它是 3.5 系列里最快的每秒吐 350 个 token价格实惠输入 0.3 美元、输出 2.5 美元每百万 token官方称质量比 3 月发布的 3.1 Flash-Lite 好很多。该模型有个灵活设计支持调「推理档位」低配活儿开最低档多步子任务调高思考档位电脑操作也做成了内置工具。与前代相比提升显著代码和 agent 任务的 Terminal-Bench 2.1 从 31% 提升到 54%长上下文的 GDM-MRCR v2 从 60.1% 提到 72.2%真实任务执行的 GDPval-AA v2 从 642 飙到 1140。有意思的是它在不少 agent 和代码任务上反超了 3 Flash如 SWE-Bench Pro54.2% vs 49.6%、OSWorld-Verified74.0% vs 65.1%可作为 3 Flash 的更快更强平替。官方还列举了其用法如从海量电商数据里抽产品特征等Ashler 等几家客户也夸赞其「速度、智能、成本三合一」。3.5 Flash Cyber专注网络安全3.5 Flash Cyber 画风突变专门用于找和修代码里的安全漏洞。Google 的逻辑是现在 AI 找漏洞速度比现有系统修漏洞速度快漏洞越堆越多所以用便宜高效的 Flash 来批量补锅。该模型在 3.5 Flash 基础上微调搭配自家的 CodeMender 工具CodeMender 里有多个 Flash Cyber agent 协同工作并汇总报告。在业内有名的 CyberGym 基准上官方称它达到第一梯队水平且比更大的模型更省 token。不过此模型暂时仅对「可信合作伙伴」限量开放走内测目的是给一线防守方争取时间修漏洞同时防止被人利用干坏事。旗舰 3.5 Pro 跳票与网友差评有疑问称发了一堆 Flash真正的旗舰 3.5 Pro 去哪了官方称「正在和合作伙伴测试准备好就上」但背后故事可能不那么体面。据彭博社等媒体报道3.5 Pro 的代码生成能力未达内部预期Google 6 月下旬更新训练数据补短板成绩仍无起色甚至有传闻称 Google 推翻原训练方案重训。Google AI 宣传委员 Logan Kilpatrick 跳过 3.5 Pro将预告重点放在 Gemini 4称已启动史上最雄心勃勃的 Gemini 4 预训练且进展令人兴奋但在「旗舰跳票」背景下有转移视线之嫌。第三方评测机构 Artificial Analysis 表示两个新模型单任务耗时减半、token 效率提升Flash-Lite 智能指数涨 11 分但 3.6 Flash 智能水平相比 3.5 Flash 基本原地踏步价格与能力不成正比。X 网友吐槽 3.6 Flash 得分与 3.5 Flash 一样不如 Meta Spark 1.1 等对手。网友 Angel 指出 Gemini 3.6 Flash 使用成本比 GPT-5.6 Sol medium 高智能程度却更低自砸「性价比」招牌。实测派也来补刀网友 Balder 称三个模型性能比 3.5 Flash 差测试问题包括基础解码毛病、中文选词离谱等还认为 Google 这么做是为把算力卖给 Anthropic。X 网友 Conor Dart 用 Google 自家的 Antigravity 跑 AI 生成游戏测试结果不理想直言等 Gemini 3.5/3.6 Pro。一边是官方漂亮账本一边是网友差评及模型背后的糟心事让人好奇 Google 是否点歪科技树只能靠 Flash 稳住场子。反正 Gemini 4 预训练已开始若再翻车阿尔茨海默的玩笑恐成谶语。

本月热点