ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测

AI前沿 | 2026年9月28日:Gemini 4 Pro 检查点曝光 + 1000 万 Token 上下文 + Terminal-bench 95.3% 实测 AI前沿 | 2026年9月28日Gemini 4 Pro 检查点曝光 1000 万 Token 上下文 Terminal-bench 95.3% 实测首屏导读 · 本教程配套付费专栏《大模型工程师修炼手记》19.9 元AI 编程 · Agent 实战 · 本文同主题系统课程· 《AI时代程序员的自我提升》49.9 元AI 时代成长方法论单篇不过瘾订阅解锁全量源码、实战与答疑文末附资料包领取方式 ↓本期导读9 月 27 日晚一批 Gemini 4 Pro 的新检查点流入社区一周之内前沿模型的竞争叙事被彻底改写。本文做四件事① 把已确认 / 仅泄露的信息严格分层上下文 1000 万 Token、输出 256K、定价 $2.25/$11.25全部未官宣② 逐个复盘 7 个被多方验证的 Demo指出它们真正证明了什么、以及没证明什么③ 拆解 DeepMind 新掌门 Koray Kavukcuoglu 罕见的公开表态里最被忽略的一条——Gemini 4 的研发正在反向定义未来两到三代 TPU④ 算一笔账如果你现在的 Agent 流水线每月消耗 5000 万输入 Token换到 $2.25 的价意味着什么。给创业者的核心判断是旗舰模型的价格锚可能再次下移一档但同时「模型自己定义芯片」意味着自研栈厂商的垂直整合护城河在变厚。一、先把信息分层哪些是官方的哪些是泄露的这是读这类「半成品模型曝光」新闻最容易出错的地方——把泄露当成官宣然后按错误的价格重算成本。所以本文第一件事是把信息分层层级项目内容可信度官方确认预训练节奏7 月启动约两个月基本结束早期预训练已全面进入后训练高Koray 公开受访官方确认发布意愿「尽可能快地发布一个早期后训练版本」「远早于年底」高官方确认内部使用Gemini 4 正被谷歌内部工程师用于Antigravity AI高官方确认目标重定义不再执着 AGI 概念——「真正的问题是我们是否有能力构建出可以完全信任的智能体」高泄露上下文窗口1000 万 Token原生中多源一致无官宣泄露输出上限256K Token中泄露定价输入$2.25/ 输出$11.25每百万 Token中泄露发布时点11 月低消息源推测流传截图基准DeepSWE v1.188%、Terminal-bench 2.195.3%称编程/智能体/推理均超 GPT-6 Astra 与 Claude Fable 5.1低无独立复现社区观察检查点代号内部代号barium-b社区称 Checkpoint 2中⚠️本文的立场泄露部分全部标注不作为你做技术选型或成本测算的唯一依据。但它们值得认真读——因为泄露的规格组合本身就在告诉你谷歌这一代要打什么牌。二、7 个 Demo 到底证明了什么以及没证明什么这是本文信息密度最高的一段。我把社区流传的高质量实测逐个拆开只回答两个问题这个 Demo 在测什么它通过了什么没通过什么#实测社区/博主任务本质在测什么观察者结论保留意见13D 浮筒飞机水面滑行起飞AI_Screening对标 Opus 5.5物理引擎代码 流体力学反馈的一致性「Opus 飞机在动但晃动剧烈、水面反馈生硬Gemini 4 Pro 加速平稳、水面反射清晰、溅水逼真」单次生成无重复实验216 分钟纯代码生成 3D 国际空间站绕地模拟thtbee_零资产依赖下的建模 素材自取能力自己用 Three.js 建模并主动抓取正确地球贴图以保证经纬度和颜色准确UI 界面被吐槽「有点丑」背面仍有透视 bug3Three.js「灯塔变火箭发射不含任何 UI」HarshithLucky3指令遵循 视觉审美严格不含 UI所有元素加了质感极佳的纹理审美在不同部件上不稳定43D 任天堂 Wii 遥控器建模LuminaBench工业设计级细节还原细节把握强、生成速度「快得难以置信」存在过度雕琢没要求的也拼命加细节部分部件违和5机器蜂鸟TimJayas「祖传」prompt对标 GPT-6 Sol复杂机械结构 动态行为理解「质量与 Fable 旗鼓相当但远好于 GPT-6 Sol」同时承认有时被 GPT-6 Astra 碾压614 分钟生成前后端完整产品展示站全栈工程产出速度「真的就是几分钟一个网站」未见后端可运行性验证7单提示词直接吐出可交互网页游戏一次性交付完整可玩物多人反馈一致玩法深度、bug 率未披露把七个 Demo 合起来看真正能得出的结论只有三条长文本代码构建的「一次性交付率」明显提升。16 分钟出一套 3D 空间站、14 分钟出一套全栈站、单提示词出可玩游戏——这三个数字指向同一件事首版可用率first-pass usable rate在涨。这比任何基准分数都更贴近工程价值。视觉/3D 感知与生成是这一代的主战场。七个 Demo 里有五个是 3D/视觉。而且第 2 条里「主动去网上抓正确地球贴图」——这是主动工具使用 事实核对的组合行为属于 Agent 能力而非纯生成能力。「过度雕琢」是一个需要管理的新缺陷类型。第 4 条明确指出你没要求的它也拼命加。对工程交付这是负资产——需求边界控制正在取代「幻觉」成为新的主要抱怨点。一个容易被忽略的判断这些 Demo 全部是「高新颖度、低验收标准」的任务3D 场景、视觉玩具。这类任务最容易产生 impressive 的观感也最难证伪。真正决定生产力的任务形态是「低新颖度、高验收标准」——改一个两周的老系统、迁移一个真实的数据库、修一个有明确回归测试的 bug。这两类任务上Checkpoint 2 的表现目前没有任何公开实测。这也是我认为这些 Demo 不能直接当采购依据的原因。三、最被忽略的一条Gemini 4 正在反向定义未来两到三代 TPU在这波曝光里几乎所有讨论都集中在「3D 生成的 Demo 好震撼」但信息量最大的一句被埋掉了——Koray Kavukcuoglu 在访谈中提到Gemini 4 的研发正在帮助谷歌的硬件工程师设计「未来两到三代的 TPU」。为什么这件事比跑分重要把它翻译成一句工程师听得懂的话1000 万 Token 上下文这个规格对硬件的要求不是「更多 HBM」而是注意力路径的访存效率。当整个网络趋向 local/sparse下面第三节的 Naive-N0.5-Flash 是极端版本芯片要优化的瓶颈从「算力峰值」转到了「长程数据搬运与稀疏访问」。因此芯片的迭代方向开始由模型的训练与推理形态决定而不是反过来。一旦模型方能自己改硬件通用推理供应商英伟达生态面临的竞争就不再是「谁的卡更快」而是「谁的模型与卡是一起长出来的」。这也解释了本周另一条新闻为什么重要Brookings 估算美国 AI 基建投资 2025–2032 年累计 10.3 万亿美元年均约占 GDP 3.6%将是美国史上单一行业占 GDP 比重最大的基建浪潮超过铁路峰值2.24%——在如此规模上芯片路线不能出错。垂直整合因此不是偏好是必须。对创业者的直接含义如果你在做推理层网关、路由、缓存、量化、推理优化未来的护城河不会是「我接了更多家 API」而会是「我理解这些模型在硬件上怎么跑」。本周另一个数据点可以印证这条llama.cpp 的 prompt-lookup 投机解码经四项优化后单 token 起草延迟从 165.48µs 降到 1.18µs约 42 倍叠加 Daniel Lemire 的阈值检查优化可达约 140 倍静态缓存加载从 3.76 秒降到 0.23 秒541MB。这类「推理系统级」优化才是长上下文时代的真实杠杆。四、算一笔账如果 $2.25 / $11.25 坐实你的成本模型会怎么变用一组常见的中等规模 Agent 负载做敏感性测算仅为推演请以你实际调用到正式版后的价格重算假设日均 200 万输入 Token / 80 万输出 Token月度 30 天。场景输入单价输出单价月度输入成本月度输出成本月度合计泄露定价Gemini 4 Pro$2.25/百万$11.25/百万约 $135约 $270约 $405上一档旗舰量级参考$5 / $25$5$25约 $300约 $600约 $900高档旗舰量级参考$10 / $50$10$50约 $600约 $1200约 $1800结论有三层同一负载下换成 $2.25/$11.25账单直接砍掉 55%–78%。对一家每月在推理上花 $2 万的团队这是每月省下的 $1.1 万–$1.5 万——足以覆盖一个小型推理优化团队的半年成本。但输出价是真正的杠杆点不是输入价。Agent 负载里输出包括思维链与工具调用轨迹通常占成本 60% 以上而输出单价是输入的 5 倍。要降本先降输出更短的思维链、更少的无效重试、更短的工具返回体截断而非全量塞回上下文。1000 万上下文不是让你「多用」的工具而是让你「少用重复」的工具。一旦整个仓库能一次性放进上下文你可以删掉大量 RAG 的检索-重排-重读链路——这省的不只是检索 API 的钱更是检索错误导致的重试成本那部分通常比 token 本身贵一个数量级。可执行的三条① 今天就把你的 Agent 负载按「输入 / 思维链 / 工具返回 / 最终答案」四类打点跑一个月看清楚哪一类占比最高② 针对占比最高的那一类设计压缩策略而不是笼统地说「换个便宜的模型」③ 在正式版到来前别急着迁移——用 A/B 把现有模型和候选模型在你自己的真实任务集上对比至少 50 条Checkpoint 的 Demo 帮不了你这个忙。五、风险清单这份曝光里可能让人踩坑的五个地方Checkpoint ≠ 正式版。社区自己的说法是「第二个检查点比第一个有了肉眼可见的巨大飞跃谷歌这次是真的在烹饪一道大菜」——这恰恰说明第一个和第二个之间的波动幅度极大。用 Checkpoint 2 的能力推断正式版是一次外推风险极高的操作。没有任何独立基准复现。88% / 95.3% 全部来自流传截图第三方机构尚未跑出可验证结果。没有独立复现的分数在采购谈判里是不成立的。11 月这个时点只有消息源推测。Koray 说的是「远早于年底」两者不是一回事。把它当规划参考不要当排期依赖。审美不稳定被系统性低估了。多个测试者独立提到「不同部件上表现不太稳定有些绝佳、有些违和」。对于面向客户交付的产品「稳定的中等」远好于「不稳定的惊艳」。2026 年 9 月初 Gemini 3.5 Pro 已经跳票过一次。社区此前记录谷歌原计划发布的 Gemini 3.5 Pro 延期内部候选模型因未能超越 Flash 系列被直接废弃。一个跳票过一代的团队它的时间表本身就有更高的方差。 本文信息来源汇总新智元经 AITNT 转载2026-09-27 23:12《刚刚Gemini 4 Pro 全新曝光实测碾压 Opus 5.5》The InformationGoogle DeepMind 掌门人 Koray Kavukcuoglu 访谈Gemini 4 预训练节奏、Antigravity AI、TPU 协同设计、发布态度社区一手实测X alannnfx检查点流出、AI_Screening浮筒飞机、thtbee_16 分钟 3D 空间站、HarshithLucky3灯塔→火箭、LuminaBenchWii 遥控器、TimJayas机械蜂鸟Seeking Alpha / Brookings哥伦比亚大学 Stijn van Nieuwerburgh美国 AI 基建 10.3 万亿美元估算2026-09-25jadidbourbaki.github.io2026-09-26llama.cpp prompt-lookup 投机解码优化约 42×–140×⚠️免责声明本文中Gemini 4 Pro 的上下文窗口、输出上限、定价、基准分数与发布时点均来自社区泄露与截图流传谷歌尚未官方确认请以谷歌官方发布为准。文中成本测算是基于假设负载的推演不构成采购建议。图表由本号基于上述公开数据绘制仅供信息参考。配套付费专栏《大模型工程师修炼手记》19.9 元—— AI 编程 · Agent 工程实战 · 本文同主题系统课程《AI时代程序员的自我提升》49.9 元—— AI 时代成长方法论单篇不过瘾订阅解锁全量源码、实战与答疑文末附资料包领取方式 ↓ 延伸阅读 · 我的付费专栏觉得这篇文章对你有帮助我把同类主题的系统化内容沉淀成了付费专栏欢迎订阅支持持续输出专栏定价内容大模型工程师修炼手记19.9 元AI 编程 / Agent 深度实战AI时代程序员的自我提升49.9 元AI 时代成长方法论 一杯咖啡的价格换来系统化的知识体系你的订阅是我持续创作的最大动力。本文配套代码 / 资料包欢迎在评论区留言「求代码」我会私信发送完整资源
返回列表