
视频版直达https://www.bilibili.com/video/av117346039502634/今日趋势速览DeepSeek V4.1 Pro 被曝进入早期测试官方尚未证实Gemini 4 Pro 泄露跑分并将上下文扩至 200 万 tokenMiniMax M3.1 Flash 预览版登陆 Token Plan 主打高并发场景同日多家巨头密集曝光新品信息模型竞争进入白热化阶段 今日要点DeepSeek V4.1 Pro 被曝进入早期测试MiniMax M3.1 Flash 预览版上线 Token PlanGemini 4 Pro 泄露跑分上下文扩至 200 万 token 今日内容汇总 AI动态DeepSeek V4.1 Pro 被曝进入早期测试MiniMax M3.1 Flash 预览版上线 Token PlanGemini 4 Pro 泄露跑分上下文扩至 200 万 tokenGemini 3.5 Progemdelta发布前最后一刻被砍Claude Sonnet 5.5 客户端配置曝光发布临近Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1Gemini 网页版被曝支持技能Gems 将转型科研智能体 OpenScience 结束测试版并登陆 Product HuntClaude Code 推出 plugin eval 插件评测命令Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1ChatGPT dots 功能内部代号曝光orbit、aeon 与 o微软开源可自我改进的 AI 技能框架 SkillOpt 开源项目GitHub 热榜 8 项目盘点Paperclip 星标破 8.5 万开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区 模型排行榜Artificial Analysis AI 模型能力排行榜 AI动态1. DeepSeek V4.1 Pro 被曝进入早期测试据泄露消息模型标识符 deepseek-v4.1-pro 已按账户进入早期测试阶段并被刻意从公开模型选择器中隐藏外界据此推测其正式发布已为时不远。DeepSeek 官方尚未证实该消息最终规格与上线时间仍以官方公告为准。 https://x.com/LuminaBench/status/21042563562830113602. MiniMax M3.1 Flash 预览版上线 Token Plan来源原文 | Lumina (AI Leaks) (Twitter)MiniMax M3.1 Flash 预览版现已在 Token Plan 上线模型更快更轻专为高并发、延迟敏感工作负载的团队打造现有订阅用户无需额外设置即可调用。与此同时该模型也已正式登陆 MiniMax Code为日常开发设计快速可靠无论是修复 Bug 还是开发完整功能都能胜任。 https://x.com/MiniMax_AI/status/21042564067865478003. Gemini 4 Pro 泄露跑分上下文扩至 200 万 token泄露数据显示Gemini 4 Pro 在 DeepSWE v1.1 拿到 88.7%、Terminal-Bench 2.1 拿到 95.3%、OSWorld-2.0 拿到 86.8%GDPval-AA v2 跑出 2064 Elo上下文扩至 200 万 token定价为每百万 token 输入 2.25 美元、输出 11.25 美元。所有数据均未经官方证实。 https://x.com/EbiThinks/status/21041685205567243614. Gemini 3.5 Progemdelta发布前最后一刻被砍有开发者透露谷歌在一切均已为最终发布准备就绪的情况下于最后一刻取消了 Gemini 3.5 Pro其内部标识符为 gemdelta。取消原因至今未获官方说明这款临阵被撤的模型也引发外界对谷歌产品线规划的诸多猜测。 https://x.com/lyraxana/status/21042011023841198745. Claude Sonnet 5.5 客户端配置曝光发布临近据爆料一份公开的生产客户端构建产物中出现 claude-sonnet-5-5 专属模型配置同一产物还引用了 claude-opus-5-5。该标识此前已现身 Droid 0.228.0 模型注册表并藏于功能开关之后Sonnet 5.5 目前疑似处于灰度测试阶段距离正式发布或已不远。 https://x.com/Mr_Salio/status/21041788546338491456. Nano Banana 2.5 Flash 在 Flow 中被改标为 2.1谷歌已在 Flow 中将 Nano Banana 2.5 Flash 的模型标注悄然改为 Nano Banana 2.1外界推测这只是一次小版本更新。目前官方尚未说明改动原因新标注也尚未正式上线后续是否伴随模型能力变化仍待观察。 https://x.com/testingcatalog/status/21042185405679247477. Gemini 网页版被曝支持技能Gems 将转型据泄露消息Gemini 网页版现已支持技能功能并计划自 2026 年 11 月 17 日起把所有 Gems 转变为技能被视为一次实用升级。谷歌官方尚未公告该变化具体迁移方式与存量 Gems 的兼容细节仍待确认。 https://x.com/LuminaBench/status/21041890647821763588. 科研智能体 OpenScience 结束测试版并登陆 Product HuntOpenScience 宣布正式走出测试版并登陆 Product Hunt新版带来更快的研究工作区 IDE模型聚合服务收录 30 多款模型含 GPT-6 Astra、Kimi K3、GLM-5.3 等共用按量付费钱包。Autoresearch 可在给定指标后自主迭代实验平台已被 30 多所高校采用免费且开源。 https://x.com/SynScience/status/21042314360522714959. Claude Code 推出 plugin eval 插件评测命令claude plugin eval 是 Claude Code 的新增命令它会将插件针对一组测试用例运行并评分再在不启用插件的情况下逐条重跑用例直观呈现有无插件的差异。开发者可借此检验插件实际价值例如在 Opus 5.5 发布后核查付费插件是否仍物有所值。 https://x.com/adocomplete/status/210401933102588349310. Supersonic Labs 发布 1.443 亿参数决策模型 Julia-1AI实验室Supersonic Labs发布轻量决策模型Julia-1参数仅1.443亿接收上下文与2到20个候选答案完成分类、打分和是非判断可为Agent选工具或路由。该模型基于mmBERT-small开发权重550MBM4上单次决策中位延迟约33毫秒训练成本约104美元已按Apache 2.0开源。 https://x.com/0xLogicrw/status/210401375163268325011. ChatGPT dots 功能内部代号曝光orbit、aeon 与 o9月26日ChatGPT网页版代码显示dots功能内部关联orbit、aeon与可能的o三个代号配置项为orbit_enabled。在此基础上该博主推测o是OpenAI下一款产品面向Pro档位可能于周二开发者大会正式揭晓。另有消息称其将于本周四正式发布Codex Plus用户将无法使用。 https://x.com/0x0SojalSec/status/210427560542878551212. 微软开源可自我改进的 AI 技能框架 SkillOpt微软把能自我改进的技能优化框架 SkillOpt 开源它会评估智能体的任务表现据此重写自身指令未通过基准测试的改动会被否决优化后的技能还可跨模型迁移复用。目前代码仓库已公开开发者可直接查看源码上手试用。以下是官方给出的 demo https://x.com/RoundtableSpace/status/2104235868298924252 开源项目13. GitHub 热榜 8 项目盘点Paperclip 星标破 8.5 万Paperclip 登上 GitHub 今日热榜第一单日新增 2000 多个 Star总量突破 8.5 万。它把 Claude Code、Codex、Cursor 等编码 Agent 接入统一管理分配岗位目标与任务还提供审批、预算和审计记录。该项目适合已在协调多个 Agent 的团队若只用一个 Agent 处理零散任务治理流程反增负担。 https://mp.weixin.qq.com/s?__bizMzUxNjg4NDEzNAmid2247537385idx1sn6f57abbd0554d6288c4aa1b3566ef70414. 开源项目 Rome 为 AI 智能体打造可积累技能的共享工作区开源项目Rome为AI智能体打造可积累技能的共享工作区智能体可在其中构建自己的工具验证有效的技能长期保留供后续复用。项目定位为人类与智能体协作的智能体操作系统可作为Grok Bot和Meta的Muse的开源替代方案代码已公开目前获597颗Star和52次Fork。 https://github.com/rome-os/rome 模型排行榜15. Artificial Analysis AI 模型能力排行榜最后是今日的 AI 模型能力排行榜单智力榜头部由Claude Opus 5.5max with fallback以58分领跑Claude Fable 5.1与GPT-6 Astra同以53分并列第二。开源与国产模型表现亮眼MiMo-V2.6-Pro以46分位列第9Qwen3.8 Max以45分排名第10双双在榜。 https://artificialanalysis.ai/以上是今天的AI 风向标欢迎在评论区提出建议我们明天见。