AI 大模型日报 — 2026-08-08 AI 大模型日报 — 2026-08-08本报告基于多源公开信息整理覆盖 2026 年 7 月下旬至 8 月上旬全球大模型领域的最新动态。 今日速览Qwen 3.8 Max 发布8 月 1 日阿里通义千问新一代 Agent 模型上线延续开源 Agent 模型路线DeepSeek-V4-Flash 正式版 API 公测7 月 31 日模型名deepseek-v4-flash即用性价比路线再进一步Anthropic 密集发力Claude Opus 57 月 23 日以半价逼近旗舰 Fable 5Sonnet 5 / Fable 5 生态成型Google Gemini Flash 三连发7 月 20 日Gemini 3.5 Flash-Lite、3.5 Flash Cyber、3.6 Flash 主打轻量高效xAI Grok 4.5 与 Moonshot Kimi K37 月 15 日相继发布Agent Coding 赛道竞争白热化LMSYS Arena Agent 榜8 月 4 日快照前 20 基本被 Anthropic 和 OpenAI 垄断DeepSeek-V4-Flash 正式版位列第 21 热门话题摘要Agent 模型成为绝对主流2026 下半年起行业分类中推理模型独立类别已无存在必要预计 2027 年删除该类别头部厂商新发模型几乎全部以 Agent 能力为核心卖点。成本战升级GPT-5.6 Terra 性能接近 GPT-5.5 但成本减半Claude Opus 5 定价与 Opus 4.8 持平、能力接近 Fable 5Gemini 3.6 Flash 输出 token 消耗较 3.5 Flash 减少 17%部分场景高达 65%。用更少 token 做更多事成为竞争主轴。代码智能体全面爆发GPT-5.6 Sol 在 Terminal-Bench 2.1 创纪录Grok 4.5 由 Cursor 团队主导训练MoE 约 1.5T 参数Claude Fable 5 仅用 1 天完成 5000 万行代码迁移。差距持续缩小国内厂商阿里、字节、腾讯、智谱、月之暗面、DeepSeek、MiniMax 等更新密集通用模型方面国外仍保持约一个身位的领先但差距在收窄。安全与对齐成为卖点GPT-5.6 配备分层防护体系Muse Spark 1.1 通过化学/生物/网络安全评估Claude 系列在提示注入防御上持续领先。 国际头部模型动态OpenAI — GPT 系列模型发布时间要点GPT-5.6 Sol / Terra / Luna2026-06Agent 模型三版本旗舰 Sol编码、生物、网络安全全面领先Terminal-Bench 2.1 创纪录平衡型 Terra性能接近 GPT-5.5、成本减半快速经济型 Luna。上下文 1.05M token最大输出 128K。7 月二次解禁新增 “ultra” 多智能体并行模式GPT-5.5 Thinking / Pro2026-04专业推理模型Thinking 主打简洁逻辑输出Pro 面向 FrontierMath、Expert-SWE 极限调优幻觉率更低GPT-Image 22026-04基于 GPT-5.4 骨干的原生图像生成模型自带推理模式Image Arena 领先 240 分Anthropic — Claude 系列模型发布时间要点Claude Opus 52026-07-23能力接近旗舰 Fable 5价格仅为其一半与 Opus 4.8 持平引入可调 effort setting 机制最低档位任务通过率仍高于其他模型Claude Fable 5 / Mythos 52026-06软件工程、知识工作、科学研究多领域 SOTA1 天完成 5000 万行代码迁移药物设计加速约 10 倍可自主通关《Pokémon FireRed》等复杂游戏。Mythos 5 安全策略更宽松仅限特定用户Claude Sonnet 52026-06维持 1M 上下文最大输出提升至 128K持久化记忆利用率更高可自主规划、调用工具执行多步骤任务性能接近 Opus 4.8Google DeepMind — Gemini 系列模型发布时间要点Gemini 3.6 Flash2026-07-20更低的成本实现更高 token 效率与更强编码/知识工作能力输出 token 较 3.5 Flash 减少 17%部分场景 65%DeepSWE、MLE Bench 等基准显著提升计算机使用内置为客户端工具Gemini 3.5 Flash-Lite / Flash Cyber2026-07-20轻量级变体覆盖低延迟与安全场景Gemini 3.1 Pro2026-02代码动画、复杂系统综合、交互式设计、创意编程能力提升Gemini 3 Deep Think2025-11增强推理模式ARC-AGI-2 得分 45.1%Nano Banana 2 / 2 Lite2026-02/07图像生成编辑模型支持 5 角色一致性、14 物体保真、多语言文本渲染Gemini Omni / Omni Flash2026-05/07视频生成与对话式编辑理解世界物理规律xAI — Grok 系列Grok 4.52026-07-15xAI 收购 Cursor 后由 Cursor 团队主导训练的 Agent 模型MoE 架构约 1.5T 参数上下文 500K token基于数 T token 的 Cursor 用户交互数据训练首个面向广泛知识工作场景不限于软件工程的 Agent 模型。针对高难度真实环境强化学习用分布式智能体系统自动构建训练环境。此前版本Grok 4.1 Thinking2025-11、Grok 42025-07。Meta — Muse Spark 系列Muse Spark 1.12026-07Meta Superintelligence Labs 多模态 Agent 模型1M 上下文支持文本/图像/视频/文档输入具备主动上下文压缩能力原生支持结构化工具调用、MCP 兼容与多智能体编排幻觉率更低通过化学生物、网络安全、失控风险三类评估。注Llama 4Scout / Maverick为上一代开源旗舰Meta 当前重心转向 Muse Spark 与 Superintelligence Labs。其他国际厂商MistralMagistral Small 1.2 / Medium 1.2 持续迭代专注小模型与细分领域Mistral 3 Medium2025-05。Runway Gen-4.52025-12视频生成速度效率保持、质量提升。 国内模型动态厂商模型要点阿里 QwenQwen 3.8 Max2026-08-01新一代 Agent 模型国内开源组持续领跑DeepSeekDeepSeek-V4-Flash 正式版2026-07-31API 公测上线模型名deepseek-v4-flashLMSYS Arena Agent 榜第 21 位国内第一梯队此前 4 月发布 DeepSeek-V4月之暗面 KimiKimi K32026-07-15新一代旗舰K2.7 Code、K2.6 持续迭代智谱 GLMGLM-4.6 系列Agentic Coding 能力大幅跃升代码能力对齐 Claude Sonnet 4寒武纪国产芯片 FP8Int4 混合量化部署腾讯混元HunyuanVideo 1.5开源视频生成8.3B 参数14G 显存消费级显卡可跑一句话生视频上线字节跳动豆包 Doubao-Seed-1.6 系列通用/推理/视频/图像多模态全家桶Seed-OSS 推理模型开源MiniMaxMiniMax-M1、H3仓库新增推理模型 语音模型持续迭代百度文心 ERNIE 5.0 Preview文本榜国内第一1432 分与 GPT-4.5/Claude Opus 4.1 并列第二梯队可灵 / 阶跃 / 万相可灵 2.6、Step 3、Wan2.2视频生成与推理模型持续更新 行业趋势分析1. 从聊天模型到Agent 模型的范式转移2026 下半年几乎所有头部新模型都以Agent 能力工具调用、计算机使用、多步骤任务、持久化记忆为核心卖点。推理模型类别正被并入通用类别标志着行业已跨越会不会推理的阶段进入能不能自主干活的阶段。2. 效率与成本成为第一竞争要素各家竞相宣传token 消耗降低Gemini 3.6 Flash -17%~65%、成本减半GPT-5.6 Terra、Claude Opus 5。轻量级变体Flash-Lite、Luna、Haiku与可调节推理档位effort setting成为标配满足日常可用性与顶尖性能统一的需求。3. 代码智能体 商业变现的主战场Cursor被 xAI 收购、Claude Code、Codex 等编码产品与底层模型深度绑定Grok 4.5 直接由 Cursor 团队主导训练说明真实用户交互数据成为模型训练的新护城河。编码基准SWE-bench、Terminal-Bench、ExploitBench竞争白热化模型在真实工程任务中的自主性持续突破。4. 竞争差距缩小但分工不同国内厂商在开源路线、多模态、视频生成、国产芯片适配上发力明显Qwen、DeepSeek、GLM、混元、可灵等更新节奏密集。通用智能与 Agent 生态的顶端仍由 OpenAI / Anthropic / Google 掌控LMSYS Agent 榜前 20 被两家美国公司垄断即为佐证。5. 安全、对齐与合规成为差异化卖点GPT-5.6 的分层防护体系模型级拒绝训练、实时生成监控、账户级行为分析展示了安全即能力的新方向。提示注入防御Claude Opus 4.5 注入成功率仅 4.7%、越狱抵抗力、CBRN/网络安全评估成为企业采购的关键指标。6. 多模态与图像/视频生成持续深化Google Nano Banana 系列、GPT-Image 2、Imagen 4、Flux 2、Veo 3.1、Gemini Omni 等表明生成模型与推理模型的融合“思考后再生成”是图像视频领域的新趋势。 参考来源LLM Statsllm-stats.com模型发布追踪2026-08 更新知乎专栏《国内外知名大模型及应用——模型/应用维度》2026-08-05 更新DeepSeek API 官方更新日志2026-07-31火山引擎开发者社区《AI大模型最新动态研究报告》2025-11 月报Jenova《GPT vs Claude vs Gemini2026年AI模型全方位对比》报告生成时间2026-08-08 由 Hermes Agent 自动整理