ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

中国AI公司从模型开源到Agent运行时开源,我们在追什么

中国AI公司从模型开源到Agent运行时开源,我们在追什么 过去两年中国 AI 行业最值得注意的一条暗线并不是又发布了多少个模型而是开源的对象正在发生变化。2024 年底到 2025 年DeepSeek、Qwen、Kimi、GLM 等公司连续把模型权重推向社区到了 2025 年以后越来越多的竞争开始从“谁的模型更强”转向“谁能把模型变成一个真正可以长期工作的 Agent”。这背后其实是一条非常清晰的技术路线变化开源模型争夺的是模型生态开源 Agent 运行时争夺的是模型之外的工作方式。而到了 2026 年这种变化已经越来越明显。DeerFlow 2.0 把重点放到长时域 SuperAgent 的编排、记忆、沙箱和 Skills 上DeepSeek Harness 甚至进一步提出“Everything is a Plugin”把模型、工具、技能、会话、沙箱、存储、循环、调度乃至 UI 都做成可以替换的插件。与此同时OpenAI 和 Anthropic 也在持续开放 Codex、Agent SDK 等基础设施。所以真正值得问的问题已经不是中国 AI 公司为什么还在开源而是从模型开源一路走到 Agent 运行时开源我们究竟在追什么我的判断是答案不是“换一个地方继续卷模型”也不是简单的“用工程能力弥补模型差距”。更准确地说我们追的是一个新的效率前沿模型能力决定上限Agent 运行时决定有多少能力能够真正兑现而真实场景数据决定这个兑现能力能不能持续提高。这也是为什么中国 AI 公司正在从模型层把战场进一步往下移动。一、第一件事不要回避模型差距但也不要把差距说大讨论所谓“战略下移”第一步必须承认一个事实在最前沿的模型能力上中美仍然存在差距但这个差距已经不是简单的“美国领先、中国落后”这么粗糙。2024 年底的 DeepSeek-V3 已经把开放权重模型的能力推到了一个新的高度。DeepSeek 官方当时强调V3 在多个评测上已经接近 GPT-4o、Claude 3.5 Sonnet 等领先闭源模型。2025 年 1 月发布的 DeepSeek-R1又进一步把推理模型的开放权重能力推到接近 OpenAI o1 的水平。随后Qwen3 在 2025 年 4 月发布继续把开源模型推向更高的编码、数学和通用能力区间。所以“中国模型不行了”显然是不成立的。但反过来直接说“开源模型已经全面追平美国前沿模型”也同样不严谨。到了 2026 年公开的模型比较仍然能看到这种结构性差异中国模型已经进入世界最前沿但美国头部模型在某些综合能力和高难度任务上依然具有明显优势。例如第三方的 2026 年模型比较中Claude、GPT 等美国前沿模型整体仍占据更高的 Frontier 指数位置与此同时Qwen、GLM、Kimi、DeepSeek 等中国模型已经稳居第一梯队在部分编码、推理和 Agent 任务上高度接近甚至在特定指标上领先。这其实是一个非常重要的判断差距正在收窄但“最强模型”的能力天花板并没有消失。因此问题才真正出现了。如果模型已经越来越接近那么继续只在“模型参数更多一点、训练时间更长一点、Benchmark 分数再高一点”这条路上竞争当然仍然有意义但它越来越不是唯一的竞争维度。因为一个 Agent 最终能不能把任务做完决定因素从来不只是模型知道什么。它还包括它能不能记住前面的状态它能不能知道自己已经做到哪一步它调用工具失败以后能不能恢复它做错一步以后能不能回滚它能不能把一个两小时的任务拆成几十个正确的子任务它能不能在中间断掉以后继续而不是从头再来它能不能判断自己“完成了”还是实际上只是“生成了一份看起来像完成了的答案”这些问题都已经超出了单纯的模型权重。Agent 时代模型只是能力的一部分。而真正决定“这份能力能不能稳定工作”的是运行时。二、从模型开源到运行时开源真正发生的是竞争层级的下移如果把过去两年的开源节奏重新排一遍这条变化会非常明显。第一阶段是模型开源。2024 年 12 月DeepSeek-V3 发布并同步开放权重2025 年 1 月DeepSeek-R1 开源2025 年 4 月Qwen3 发布随后 Kimi K2、GLM 系列等开放权重模型不断加入竞争。这一阶段最核心的价值是把“模型能力”快速扩散到产业和开发者社区。模型不再是只能通过 API 调用的黑盒而开始变成可以下载、部署、微调、蒸馏和二次开发的基础设施。DeepSeek-R1 甚至明确采用 MIT License并允许基于模型输出进行蒸馏。第二阶段是 Agent 基础设施开始开放。这里尤其需要纠正一个常见的时间线误读。OpenAI 的 Codex CLI 并不是 2025 年下半年才开始开放而是在2025 年 4 月就作为一个轻量级、开源的终端 Coding Agent 发布仓库采用 Apache-2.0。之后Codex 又逐步从 CLI 扩展到云端产品和 SDK2025 年 10 月OpenAI 正式发布 Codex SDK。Anthropic 也走出了类似但不完全相同的路径。2025 年 2 月Claude Code 随 Claude 3.7 Sonnet 发布最初是一个研究预览的终端 Coding Agent。到了 2025 年 9 月Anthropic 发布 Claude Agent SDK并明确把 Claude Code 背后的核心工具、上下文管理和权限框架开放给开发者用来构建自己的 Agent。换句话说真正值得作为“运行时开放”节点来看的是Claude Agent SDK而不是一个所谓 2025 年 8 月公开 Claude Code 源码的节点。到了 2026 年这一趋势进一步向“长程 Agent Harness”发展。DeerFlow 2.0 在 2026 年 2 月首次发布随后在 6 月形成 2.0.0 正式版本。它已经不再是传统意义上的 Deep Research 框架而是围绕 SuperAgent Harness 重构把子 Agent、持久化记忆、沙箱执行、Skills、工具、运行状态等都纳入一个完整的长程任务系统。而 DeepSeek Harness 在 2026 年 8 月又进一步把这个方向推到了一个更彻底的位置Everything is a Plugin。DeepSeek 官方对 DSH 的定义非常直接模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等 Agent 能力都可以作为插件自由组合底层 Cordis Kernel 本身并不承载具体的 Agent 能力。这说明竞争正在发生一次非常明确的迁移以前是在比谁拥有最强的模型现在越来越是在比谁定义了 Agent 的工作方式。三、为什么美国在 Coding Agent 上更占优势如果只看模型很容易产生一个错觉既然中国模型已经进入第一梯队中国理应马上在所有 Agent 场景反超。但现实并不是这样。最典型的例子就是 Coding Agent。Claude Code 的优势很早就不是简单的“Claude 模型更聪明”这么单一。它实际上把模型、终端、文件系统、权限控制、上下文管理、代码编辑、Git 工作流以及开发者习惯整合成了一个完整的工作环境。OpenAI 的 Codex 也在沿着同样的方向推进从 CLI 到云端再到 SDK再到多 Agent 协同和长期任务管理。2026 年 OpenAI 自己公开讨论“harness engineering”时甚至把 Agent 时代的软件开发重点定义为人负责设计环境、明确意图和反馈回路Agent 负责执行。也就是说Coding Agent 的竞争早就不是模型排行榜的竞争而是工作流的竞争。这也是为什么中国模型厂商虽然已经有很强的代码模型却不一定能自然转化成同等强度的 Coding Agent 产品。因为“模型能力”和“开发者心智”是两个东西。Claude Code 已经拥有大量真实代码库、开发者反馈、终端交互习惯和工作流数据。所以这里存在一个很现实的问题模型强不等于 Agent 强。Agent 强甚至不完全意味着模型最强。它更像是模型 × 工具 × 上下文 × 状态 × 权限 × 反馈 × 工作流共同决定最后的成功率。而这里恰恰是中国 AI 公司可以重新选择战场的地方。四、所以真正应该避开的不是“编码”而是美国已经形成闭环的编码入口如果继续追问中国 AI 公司为什么越来越强调办公 Agent最容易得到的答案是“因为办公场景更容易。”这个答案恰恰错了。办公 Agent 一点都不容易。真正复杂的办公任务往往比一个简单代码修改更长、更杂、更依赖上下文。比如“基于过去三个月的业务数据整理一份季度经营分析找出异常向各业务负责人发邮件确认再把确认结果更新到表格最后形成管理层汇报。”这已经不是一次问答。它包含搜索、读取文件、数据分析、判断、工具调用、跨应用操作、状态保存、等待外部反馈、再次执行、结果校验甚至可能跨越几个小时甚至几天。这就是所谓的Long Horizon Task。问题来了既然办公任务更复杂为什么反而应该成为中国公司的机会因为真正稀缺的不是任务本身。而是三个东西是否同时存在入口、数据、场景。中国大型互联网和企业软件公司恰恰拥有这三样东西。飞书、钉钉、企业微信以及围绕文档、会议、审批、CRM、协同办公形成的大量系统本身就是企业工作流的入口。这意味着一个办公 Agent 如果真正嵌入工作系统就不是“帮你写一段内容”。它是在参与工作本身。这会带来一个非常不同的反馈机制。用户不是简单告诉模型“这份回答好不好。”而是会直接用行动告诉系统“你做的事情最终有没有完成。”例如合同有没有真的生成审批有没有真的走完会议纪要有没有被采用数据表有没有正确更新客户有没有收到邮件流程有没有被卡住任务有没有在中途失败这种反馈比单纯的“喜欢/不喜欢”更有价值。因为它是任务级反馈。而这正是长程 Agent 最需要的数据。五、真正值得追的不是“运行时”而是运行时背后的数据飞轮讲到这里终于可以把整件事说透。如果把模型想象成一个人的“大脑”那么 Agent Harness 更像是这个人的工作系统。它负责记住事情安排任务调用工具管理权限记录状态处理失败重新尝试验证结果恢复中断甚至决定什么时候应该停止。因此一个 Agent 的实际能力不是Model Capability而更接近Model Capability × Runtime Reliability × Environment Feedback而且这里存在一个极其重要的区别运行时不能突破模型的能力天花板但可以决定你能不能把天花板附近的能力真正用出来。这是理解 LongHorizon-Harness 最重要的一点。2026 年 8 月发布的 LongHorizon-Harness不是简单地宣布“模型不重要了”。它提出的核心问题是长程任务中如果把任务状态混杂在不断膨胀的上下文中错误信息和错误自我判断会不断传递最终导致 Agent 崩溃。它因此把任务执行重新定义为一个“状态管理问题”采用 Manage-Execute-Audit也就是管理、执行、审计的循环让状态位于执行过程之外并由环境事实进行验证。最直观的实验结果是同一模型 Qwen3.7-Plus 在 WeaveBench 上从51.8% 提升到 80.7%在 Terminal-Bench 2.1 上从 69.7% 提升到 77.2%。这说明 Harness 的确可以显著改变同一个模型在长程任务上的实际表现。但必须把边界说清楚这不意味着 Harness 可以把弱模型变成强模型。它更准确地说明模型能力是上限Harness 决定你离这个上限还有多远。这两句话看似只差一点实际上是两种完全不同的战略。六、而一旦把“办公”加入进来事情就从工程问题变成了数据问题假设两个团队拥有能力相近的模型。A 团队有一个非常好的通用模型但对企业办公场景没有足够的数据。B 团队的模型略逊一些但它的 Agent 每天都运行在真实的企业办公系统里面。那么 B 最终可能获得一种非常重要的优势它知道 Agent 为什么失败。它知道哪些任务最容易失败在哪一步最容易丢状态哪些工具组合最稳定哪些操作最容易触发权限问题哪些任务需要重新规划什么时候应该让 Agent 停止什么时候需要把长任务拆成多个阶段哪些失败是模型问题哪些失败其实是运行时问题。这类知识不会自然地出现在模型参数里。它来自真实世界的交互记录。于是一个新的飞轮就出现了开源 Harness↓吸引开发者和企业使用↓真实任务进入系统↓产生工具调用、状态变化、失败记录和任务结果↓这些数据反过来改进 Harness↓更稳定的 Harness 带来更高的任务完成率↓更多企业愿意把更复杂、更长期的任务交给 Agent↓产生更多真实任务数据这时候开源的价值就发生变化了。你开源的其实不是最终护城河。你开源的是进入护城河的入口。七、为什么“运行时开源”反而可能比“模型开源”更值得做乍看之下这似乎是一件很奇怪的事。模型已经是最核心的技术资产为什么可以开现在连运行时都要开难道不怕别人复制吗真正的答案恰恰是运行时代码本身未必是最值得保护的东西。因为代码是可以复制的。但以下这些东西极难复制你的用户你的真实任务你的企业工作流你的失败案例你的反馈数据你的工具生态你的运行经验以及由这些东西长期沉淀出来的工程知识。这也是为什么 DeepSeek Harness 的“Everything is a Plugin”值得重视。它甚至没有选择把一个复杂、封闭、不可替换的 Agent 系统做成“黑盒产品”。相反它把模型、工具、Skills、存储、调度等都拆成可以被替换的能力单元。这实际上是在主动降低进入门槛。因为越容易接入越容易产生真实使用。而真实使用才是 Agent 时代真正稀缺的东西。八、这也是中国公司为什么值得押“办公 Agent”如果把整个竞争格局放到一起看就会发现一个很有意思的对称关系。在 Coding Agent 上美国公司拥有很强的优势有模型有开发者有成熟的终端产品有 IDE 和 GitHub 等生态有长期积累的开发者工作流数据。因此Claude Code 和 Codex 可以不断增强自己的 Coding Agent 闭环。而中国公司的优势在哪里恰恰不是在“把 Claude Code 再做一个”。中国公司更有机会建立自己的闭环办公入口 Agent Runtime 企业工作流 场景数据。飞书、钉钉、企业微信等并不是简单的办公软件它们本质上都是企业信息流和工作流的基础设施。过去这些系统承担的是“人通过软件完成工作。”未来它们可能越来越变成“人通过 Agent 编排软件完成工作。”这两个时代最大的区别是以前软件是工具。以后软件可能成为 Agent 的执行环境。这时候办公软件本身就会从“应用入口”升级成“Agent Runtime 的现实世界”。因此办公并不是退而求其次的选择。恰恰相反它可能是中国公司最有机会形成独立优势的 Agent 战场。九、真正应该追求的不是“用弱模型打败强模型”这里一定要避免一个非常容易传播、但逻辑并不成立的说法“既然 Harness 很重要那是不是意味着一个弱模型加上好 Harness就可以超过最强模型”答案是不应该这么说。LongHorizon-Harness 的实验已经证明好的 Harness 可以把同一个模型的实际任务表现从 51.8% 推到 80.7%。但这说明的是Runtime 能显著提高能力兑现率。它并不意味着Runtime 能消灭模型能力差距。这一区别非常重要。一个模型不会因为状态管理更好就突然获得原本不存在的世界知识也不会因为工具调度更优秀就自动拥有另一个更强模型的推理能力。因此真正值得追的不是“我们什么时候能让中国模型智商全面超过美国模型”而是在一个具体、真实、长期运行的任务环境里我们能不能让每一单位模型能力都产生更多有效产出换句话说模型竞争看的是“理论能力”。Agent 竞争看的是每 100 个 Token、每 1 美元算力、每 1 小时运行时间到底能完成多少真实任务。这才是工程系统真正关心的效率前沿。十、于是中国 AI 的下一阶段竞争逻辑就变得非常清楚过去我们追的是模型参数Benchmark训练成本推理速度。现在正在变成AgentHarness长程任务工具生态真实工作流数据反馈。这并不是说模型竞争结束了。恰恰相反模型依然是一切的基础。只是到了 Agent 时代模型不再是全部。真正的竞争单位正在发生改变。以前比较的是谁的模型更强。后来比较的是谁的模型 × 产品更强。再往后比较的是谁的模型 × Harness × 工具 × 场景 × 数据飞轮更强。而这最后一个系统才是真正难以复制的。结语我们真正追的是“能力兑现率”所以把中国 AI 公司从模型开源一路走到 Agent 运行时开源理解成一次简单的技术迁移其实还不够准确。这背后实际上是一次竞争范式的迁移。模型开源解决的是如何把模型能力迅速扩散出去。运行时开源解决的是如何让更多 Agent 在真实环境里运行起来。而一旦这些 Agent 真正在现实世界里持续运行真正有价值的就不再只是模型权重也不只是几万行 Harness 代码。真正产生价值的是真实任务、真实反馈、真实失败、真实工作流以及围绕这些东西形成的数据和工程闭环。所以中国 AI 真正应该追的不是一个抽象的“美国模型分数”。我们要追的是另一个指标同样的模型能力谁能让它完成更多任务同样的算力成本谁能让 Agent 工作更久同样一个复杂场景谁能让它更稳定地从开始做到结束。这就是为什么从 DeepSeek-V3、R1到 Qwen3、Kimi、GLM再到 DeerFlow、LongHorizon-Harness、DeepSeek Harness开源的对象正在一路向下移动。看起来我们是在从“开源模型”走向“开源运行时”。实际上我们是在从争夺模型能力走向争夺 Agent 的工作方式再从争夺 Agent 的工作方式走向争夺真实世界的反馈数据。最终真正决定胜负的也许不是谁拥有最高的智商而是谁能够把智商最稳定、最高效、最低成本地兑现成真实生产力。模型决定上限。运行时决定兑现率。场景数据决定迭代速度。而中国 AI 公司今天真正值得争夺的正是这三者叠加之后形成的那条新飞轮。
返回列表