
AI 应用简报 07.28-07.31扩散模型杀入 Agent 赛道三项反超自回归核心观点Agent 赛道自回归模型一统天下的局面在 7 月最后一周被一只黑天鹅打破了——蚂蚁集团发布了全球首个能在 Agent 长程任务上击败自回归的扩散模型。与此同时MCP 协议完成史上最大升级亚马逊 AGI 总监公开喊话可靠性而非能力才是企业部署的真正瓶颈。上期AI 应用简报 07.23-07.2769% 用户对伴侣隐瞒 AI 使用1. 扩散模型杀入 Agent 赛道三项测试反超自回归[B] 蚂蚁集团 inclusionAI 团队 7 月 28 日甩出一张牌LLaDA 2.2千亿参数 MoE 扩散语言模型全球第一个敢在 Agent 长程任务上正面硬刚自回归模型的扩散架构。怎么做到的三层技术叠加Levenshtein 编辑机制让模型在生成中边做边改KEEP/SUBSTITUTE/DELETE/INSERT 四种原子操作L-EBPO 强化学习根据环境反馈自主决策编辑动作解决了长程 Agent 交互中致命的模型崩溃BlockRouting块级路由压住 128K 上下文下的推理成本。结果在 7 大 Agent 基准测试中LLaDA 2.2-flash 与顶尖自回归模型 Ling-2.6-flash 平均分53.83 vs 55.74差距缩到 2 分以内。τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上直接反超。BF16 吞吐量是自回归的 1.64 倍。我判断这不是又一个新模型发布——这是 Agent 技术栈的底层路线分裂。2025 年全行业默认Agent 自回归 LLM tool callingLLaDA 2.2 证明了还有另一条路。扩散模型在低延迟、低成本、可纠错的端侧和工业 Agent 场景中的优势可能会在下半年逼出一批跟随者。2. MCP 史上最大更新全面无状态化 MCP Apps/Tasks 正式毕业[A] 7 月 28 日同一天MCP 发布了自 2024 年 11 月问世以来最大规模的规范修订。核心变化就五个字彻底无状态化。取消initialize/initialized握手流程干掉 Session ID每个请求自包含——现在可以直接部署在 AWS Lambda、Cloudflare Workers 上做水平扩展不再需要 sticky session。三件事同时毕业1MCP Apps——服务端渲染的交互式 UI仪表盘、表单、可视化直接嵌入 AI 客户端Agent 不只是对话工具调用而是可以推界面2MCP Tasks——长运行异步操作 持久化任务句柄断连后恢复轮询——这是 Agent 生产化的基础能力312 个月正式弃用策略——企业终于有了版本稳定的承诺。安全侧同步加固OAuth 2.0/OIDC 强制 issuer 验证防混用攻击与 Okta 合作开发企业托管授权扩展。规范由 Linux Foundation 下的Agentic AI Foundation (AAIF)发布成员从 2025 年 12 月的 ~40 家暴增至240 家。SDK 月下载 9700 万。MCP 从协议标准到企业 Agent 治理基础设施层的转型在这一版规范里正式画上了句号。3. 亚马逊 AGI 总监可靠性不是能力才是企业部署的瓶颈[A] VB Transform 2026 上Amazon AGI Director Bryan Silverthorn 说了一句让在场企业客户集体点头的话“Agent 的能力已经够了。可靠性远远不够。”他甩出的数据1在 Demo 里正常工作的 Agent88% 在生产中失败2单 Agent 每步 99% 准确率 × 20 步 仅 82% 端到端成功率三 Agent 链每个 70% →34%3连续跑 8 次成功率从 60% 自由落体到25%。这不是孤例。Kore.ai 2026 调查同步印证82% 企业 Agent 在无监管下执行关键操作、79% 需人工回滚、42% 经历了收入损失。Gartner 预测 40% Agentic AI 项目 2027 年底前取消。同一周Diagrid 发布了Catalyst 2.0——跨框架LangGraph / MS Agent Framework / Google ADK / CrewAI / OpenAI Agents SDK / Claude Managed Agents的持久化执行 密码学可验证中间件不需要改一行代码。它就是 Silverthorn 诊断的那个问题的产品化应答。下半年 Agent 行业的主旋律已经定了从让 Agent 更聪明转向用约束换可靠性。4. AI 推理基础设施融资狂潮一周内四笔巨型交易[B] 7 月中旬起AI 基建融资密集到让人喘不过气Fireworks AI$15.1 亿 D 轮$175 亿估值Nvidia 背书年化收入破 $10 亿客户Uber、Shopify、DoximityTogether AI$8 亿 C 轮$83 亿估值Aramco Ventures 领投年化 booking 超 $11.5 亿Etched$3 亿 C 轮$103 亿估值Sequoia 领投专做 AI 推理 ASIC 芯片Crusoe洽谈 ~$30 亿融资$300 亿估值定位AI 数据中心新云Mira Murati 的 Thinking Machines Lab成立不到一年$20 亿种子轮后已在谈 $500-600 亿估值新轮vLLM SGLang 7 月 5 日联合发布Unified Inference Runtime 3.0阿里云 PAI / AWS SageMaker / 火山引擎已采用为默认推理基座。钱在往哪里流四个字推理基础设施。Fireworks 做推理平台Together 做开放模型云Etched 做定制芯片Crusoe 做数据中心。四个不同切入点同一个赌注——AI 推理要变成像用电一样的按需基础设施。标准化的开源运行时vLLM/SGLang和巨量资本同时涌入通常意味着赛道上半场结束的信号。5. ThinkSono 获 FDA 批准AI 让非专科医生也能做超声[B] ThinkSono 7 月 29 日拿到 FDA 510(k) 批文。它的 AI 系统通过计算机视觉引导非超声专业临床医生获取诊断级血管图像——把原来只有超声技师才能做的深静脉血栓DVT检查下沉到急诊室和基层诊所。这件事和 UpDoc首个含 LLM 的 FDA 批准患者端 SaMD、Bayesian Health脓毒症 AI 获 CMS 医保支付放在一起看2026 年的趋势很清楚临床 AI 从帮放射科医生读片扩展到赋能非专科医生自主操作。Q2 2026 全季度 FDA 批了 86 项 AI/ML 设备累计 1537 项12 项引用了前瞻性变更控制计划PCCP。6. FSB 发布 12 项 AI 稳健实践Agent 需要身份证[B] 金融稳定理事会FSB6 月发布《负责任 AI 采用稳健实践》咨询报告。最引人注目的是一条给 AI Agent 分配个体标识符。这意味着什么每个 Agent 的行为可以被追踪到具体实例——谁部署的、什么时候、做了什么决策。配合限制 Agent 未经审批与外部系统交互和客户资金交易特殊控制条款FSB 正在为 Agent 画出第一条全球性的治理红线。中国 NFRA 金发 8 号文同步落地——“谁使用谁负责” 个人信息禁入训练 人类最终决策权。FIS 联合 Anthropic 推出金融犯罪 AI AgentBMO 和 Amalgamated Bank 首批采用。监管在追着技术跑。四条路线——中国画线式、英国原则式、美国技术中立、韩国综合立法——在 Agent 时代被进一步拉大。7. Cursor Claude Code 子 Agent 开始互操作[B] Cursor 3.11 新增 Side Chats、Conversation Search、Cloud Agent Hooks。Claude Code 2.1.200 实现 1M token 上下文 GA子 Agent 5 层嵌套。真正值得关注的细节是Cursor 可以直接读取.claude/agents/目录——一次编写子 Agent 定义两个环境都能跑。这不是偶然。开发者正在形成双工具并用模式Cursor 负责可视化编辑和 Tab 补全Claude Code 负责自主多文件重构和深度终端工作合计月费 ~$40。子 Agent 定义格式.claude/agents/目录结构如果被更多工具采纳可能成为编程 Agent 的跨平台事实标准。我赌什么这一周五条线——MCP 无状态化、扩散模型 Agent 化、Agent 可靠性危机被公开点名、推理基建融资狂潮、FSB 给 Agent 发身份证——不是巧合。它们是 Agent 产业从概念验证进入工业化的集体信号。我赌下半年最值得押的方向不是更聪明的 Agent而是**可靠的 Agent 可验证的执行 可审计的治理三位一体**。谁先把这个三角拼出来谁就能吃到企业预算从试试看切换到必须上的最大一波红利。至于扩散模型能不能真正威胁自回归在 Agent 领域的地位——先不下结论。LLaDA 2.2 的表现惊艳但一次反超还不足以改朝换代。我会盯紧三季度有没有跟随者。AI 辅助研究个人视角解读。周一、五更新。