ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

卷疯了!谷歌突袭Gemini 3.8 Flash与Cyber,Meta发布Muse Spark 1.3,GPT Astra发布候选曝光 | 9月3日 AI日报

卷疯了!谷歌突袭Gemini 3.8 Flash与Cyber,Meta发布Muse Spark 1.3,GPT Astra发布候选曝光 | 9月3日 AI日报 视频版直达https://www.bilibili.com/video/av117204758829279/今日趋势速览谷歌6周内第3次更新发布Gemini 3.8 Flash与安全版Flash Cyber主打漏洞检测。Meta随后推出Muse Spark 1.3工具调用与token消耗双降。同时GPT Astra两个检查点现身测试巨头们围绕效率与安全加速内卷。 今日要点谷歌发布 Gemini 3.8 Flash 与 Flash CyberMeta 发布 Muse Spark 1.3主打智能体与编码任务GPT Astra 新检查点测试中含发布候选与安全变体 今日内容汇总 AI动态谷歌发布 Gemini 3.8 Flash 与 Flash CyberMeta 发布 Muse Spark 1.3主打智能体与编码任务GPT Astra 新检查点测试中含发布候选与安全变体探测称 gpt-6-astra 真实存在为类 cyber 的变体阿里发布Qwen3.8-Max-0902参数达2.4万亿美团 LongCat-2.0 在 Cline 免费开放使用西班牙 Multiverse 发布 Quasar 438B 推理模型Claude 新增后台操作电脑能力可代人点击输入开应用Claude Commerce Agents 开源购物与商家智能体蓝图蚂蚁集团开源 UI-Venus-2 通用 GUI 智能体MiniMax H3 Max 上线 OpenRouter更快更便宜Perplexity 开源本地推理引擎 Lily专攻 Apple 芯片月之暗面Kimi API 兼容 OpenAI 与 Anthropic 接口Fal 发布 H3 Max Turbo 预览版速度翻倍成本减半H3-World将 MiniMax-H3 直接改造为世界模型 模型排行榜Artificial Analysis AI 模型能力排行榜 AI动态1. 谷歌发布 Gemini 3.8 Flash 与 Flash Cyber谷歌发布Gemini 3.8 Flash及安全版Flash Cyber这是6周内第3个Flash版本。Cyber面向防御者主打漏洞检测与修补。新模型定价每百万token输入0.75美元当天全渠道上线并登陆Antigravity平台Arena排名升6位。 https://x.com/GoogleDeepMind/status/20951752698674708422. Meta 发布 Muse Spark 1.3主打智能体与编码任务Meta 发布 Muse Spark 1.3效率方面对比上一代1.2工具调用次数减少约20%token消耗减少约25%。基准测试中在第三方Artificial Analysis智能指数中Muse Spark 1.3以61分跻身前列与GPT-5.6 Sol并列领先DeepSeek等多款模型。 https://x.com/AIatMeta/status/20952343851299636663. GPT Astra 新检查点测试中含发布候选与安全变体有测试者发现两个 GPT Astra 检查点 ultima-alpha 与 vega-alpha 正在测试前者疑似面向公众发布的候选版本后者是专注网络安全的变体供部分企业用于安全工作。实测显示Astra 确实专为长时间运行的任务与编排而打造。 https://x.com/Lentils80/status/20952116854392629584. 探测称 gpt-6-astra 真实存在为类 cyber 的变体探测者称gpt-6-astra已在OpenAI API上预置上线Responses API对它返回404 Not Found。分析指出gpt-5.7并不存在sol、terra、luna、cyber等端点全部返回400注册slug返回404正是受限的表现。因此astra是变体类似gpt-5.6-cyber在5个端点上与cyber字节级一致而cyber是已发布但受限的模型。 https://x.com/chetaslua/status/20952077793720731925. 阿里发布Qwen3.8-Max-0902参数达2.4万亿阿里发布升级版大模型Qwen3.8-Max-0902拥有2.4万亿参数和100万上下文标记定价方面该模型每百万token输入2美元、输出6美元缓存命中成本低至0.17美元。此外经编码与协作方向进一步训练多项评测成绩超越前代模型现已通过QwenCloud API上线。 https://x.com/Alibaba_Qwen/status/20949687082886802766. 美团 LongCat-2.0 在 Cline 免费开放使用编码智能体 Cline 宣布美团的 LongCat-2.0 现已免费提供。这是一个 1.6T 参数的开放权重 MoE 模型支持 1M 上下文评测表现与 Claude Opus 4.7、Gemini 3.1 Pro 相当。用户安装 Cline 后用 /model 命令切换即可调用。 https://x.com/cline/status/20949030894092616677. 西班牙 Multiverse 发布 Quasar 438B 推理模型西班牙公司 Multiverse Computing 发布首个大模型 Quasar 438B4380 亿参数的推理模型支持 1M 上下文主攻企业级 Agent 与编码。Artificial Analysis 独立实测给出 43 分高于 Mistral Medium 3.5 的 30 分成为榜单中得分最高的欧洲模型但与全球前沿仍有差距。 https://x.com/MultiverseCompu/status/20950610115018466318. Claude 新增后台操作电脑能力可代人点击输入开应用Claude 官方宣布Claude 现可在 Claude Cowork 与 Claude Code 中后台操控用户电脑给它一个桌面任务后它会像本人一样完成点击、输入与打开应用等操作用户可同时继续处理其他工作无需独占屏幕。 https://x.com/claudeai/status/20952268332936851009. Claude Commerce Agents 开源购物与商家智能体蓝图Anthropic 面向开发者开源 Claude Commerce Agents将其定位为构建购物与商家智能体的蓝图覆盖零售、旅行、电信与娱乐等领域并提供对应的参考实现帮助开发者在此基础上快速搭建自己的电商场景 Agent。以下是官方给出的 demo https://x.com/ClaudeDevs/status/209523374516728260210. 蚂蚁集团开源 UI-Venus-2 通用 GUI 智能体蚂蚁集团发布通用GUI智能体UI-Venus-2将移动端、网页端与桌面端控制统一到单一端到端模型并已在Hugging Face开源9B与27B两档检查点。多项基准测试显示该模型在VenusBench-Mobile、WebVoyager、OSWorld-Verified等评测中领先多个主流模型并具备规模化训练环境与基于关键点的验证机制。 https://x.com/HuggingPapers/status/209518331584224474611. MiniMax H3 Max 上线 OpenRouter更快更便宜MiniMax H3 Max 现已上线 OpenRouter定位比 H3 更快、更便宜。相同提示词的并排对比显示约 30 秒即可完成就绪而原版需要约 3.5 分钟单个片段的费用也从 0.65 美元降到 0.40 美元生成成本与等待时间同步下降。以下是官方给出的 demo https://x.com/OpenRouter/status/209517314140453312812. Perplexity 开源本地推理引擎 Lily专攻 Apple 芯片Perplexity 宣布开源本地推理引擎 Lily。它为 Perplexity Computer 的混合计算而构建专门针对 Apple 芯片上的 Qwen3.6-35B-A3B 模型优化目标是让设备端推理足够快不会成为 Computer 任务的瓶颈相关代码现已公开。 https://x.com/perplexity_ai/status/209524154438322627413. 月之暗面Kimi API 兼容 OpenAI 与 Anthropic 接口月之暗面宣布Kimi API已支持OpenAI Responses API与Anthropic Messages APICodex、Claude Code等编码工具可通过自定义模型供应商直连kimi-k3等模型官方同时提醒Responses API目前仅支持文本与图片暂不支持视频。桌面客户端的模型选择器可能显示为自定义实际使用的是Kimi K3等模型。 https://x.com/RocM301/status/209514348128733612614. Fal 发布 H3 Max Turbo 预览版速度翻倍成本减半Fal 发布视频模型 H3 Max Turbo 预览版速度翻倍、成本减半官方称评估中力争达到原 H3 Max 质量的第 97 百分位仍优于 H3 等所有视频模型。促销价下 768p 视频输出每秒仅 0.01 美元提示理解与美学表现保持不变。 https://x.com/fal/status/209521054008388445315. H3-World将 MiniMax-H3 直接改造为世界模型研究团队公开 H3-World称其为首个将 MiniMax-H3 本身转化为世界模型的成果无需新增动作模块直接把 H3 预训练获得的语言理解能力转化为世界控制能力整个微调仅使用 8K 样本与 0.199% 的可训练参数。以下是官方给出的 demo https://x.com/yxy2168/status/2094996731079622690 模型排行榜16. Artificial Analysis AI 模型能力排行榜智力榜由Claude Fable 5.1以66分登顶Claude Opus 5 (63分)、Muse Spark 1.3 (62分)紧随。智能体榜同款Fable 5.1以61分居首Muse Spark 1.3、Claude Opus 5与GLM-5.3同以59分并列其后。开源阵营亮点在GLM-5.3智力榜第9名60分智能体榜并列第4名59分双榜均衡。 https://artificialanalysis.ai/以上是今天的AI 风向标欢迎在评论区提出建议我们明天见。
返回列表