ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Astra 给开源模型出了一道什么题?从 AGI 到图形世界,DeepSeek、Kimi、Qwen 谁更接近下一代 AI?

Astra 给开源模型出了一道什么题?从 AGI 到图形世界,DeepSeek、Kimi、Qwen 谁更接近下一代 AI? Astra 给开源模型出了一道什么题从 AGI 到图形世界DeepSeek、Kimi、Qwen 谁更接近下一代 AIGPT-6 Astra 发布以后很多讨论集中在一个词AGI。OpenAI甚至把 Astra 描述成“新一代智能”并公布了 ARC-AGI-3 99.9%、FrontierMath Tier 4 98% 等成绩与此同时Astra 在 computer use、浏览器操作、软件工程和专业工作上的能力也被放到了非常核心的位置。但如果站在开源模型的角度我认为 Astra 真正出的一道题并不是谁的模型更聪明而是一个 AI 能不能从“理解世界”进一步发展到“构造世界、操作世界并验证结果”这可能比传统意义上的大模型 Benchmark 更重要。一、Astra 的变化AGI 不再只是“更聪明的聊天机器人”过去几年大模型竞争的逻辑相对容易理解参数更多、知识更多、数学更强、代码更强、上下文更长。但是 Astra 展现出的路线正在发生变化。它的重要能力之一是computer use。也就是说AI 不只是告诉你“应该怎么做”而是开始真正进入软件、浏览器和计算机环境中完成任务。OpenAI将 computer use、browsing、software engineering、science 和 professional work 都列为 Astra 的核心能力。这意味着一个重要变化LLM → Reasoning Model → Agent → General Computer Agent而我认为后面还有一步General Computer Agent → Generative World Agent这一步就是“图形”。二、为什么“图形”可能成为下一场真正的竞争这里说的图形不只是 AI 画一张漂亮图片。今天的大模型面对的世界本身就是图形化的网页是图形界面Windows 是图形界面CAD 是图形Blender 是三维图形游戏是实时三维世界ComfyUI 是节点图视频编辑器是 Timeline工业数字孪生是三维空间甚至企业软件本质上也是数据结构在 GUI 上的视觉表达。因此真正通用的 Agent 必须建立一个循环理解目标 ↓ 观察环境 ↓ 建立内部世界模型 ↓ 规划 ↓ 操作工具 ↓ 生成/修改图形 ↓ 观察结果 ↓ 判断是否符合目标 ↓ 修正这和传统的Prompt → Answer已经完全不是同一种 AI。Astra 给开源模型真正出的题可能就在这里。三、DeepSeek推理很强但需要继续补上“眼睛和手”DeepSeek 的优势一直比较鲜明推理、代码、Agent以及极高的计算效率。到 2026 年 8 月DeepSeek V4 Pro 已经明显强化 Agent 能力随后发布的 V4-Flash-Vision-Exp 又进一步补上视觉 Agent 能力。DeepSeek 官方特别指出在需要视觉理解的 Agent Benchmark 上新视觉模型相比纯文本版本有明显提升。所以 DeepSeek 的演进路线很有意思Reasoning → Coding → Agent → Vision Agent这是非常合理的一条路线。但面对 Astra 提出的新问题DeepSeek 下一步需要解决的不只是“看懂图片”。看懂 GUI与真正操作 GUI是两回事。进一步说看懂 Blender与自己构造一个 Blender Scene又是两回事。因此 DeepSeek 最值得观察的是能否把强大的推理能力进一步延伸成稳定的Visual Planning Tool Execution Verification。如果做到这一点它会非常强。因为它本来的“大脑”已经足够好下一步主要是给这个大脑安装更加成熟的眼睛和手。四、Kimi可能是目前最值得观察的“Agent 化”开源路线Kimi 的路线与 DeepSeek 有明显区别。Kimi 更积极地把长上下文 Vision Coding Agent 多 Agent揉成一个整体。目前 Kimi K3 已经是原生视觉模型最高支持 1M context官方定位也是 long-horizon coding 和 end-to-end knowledge work。而此前 Kimi K2.5 已经明确提出一个很有意思的概念Visual Agentic IntelligenceKimi甚至专门展示了 Image/Video → Code、视觉调试、前端界面生成以及 Agent Swarm。这个方向非常重要。因为下一代 Agent 面临的问题经常不是“这个按钮是什么”而是“我要完成这个目标现在这个界面处于什么状态下一步应该操作什么操作以后结果是否正确”这是状态空间推理。所以 Kimi 的一个潜在优势是它正在尝试把“看”和“做”放进同一个 Agent 框架里。如果把这个能力继续扩展到 Blender、CAD、ComfyUI、Premiere、Unreal Engine那么它距离真正意义上的Visual Creation Agent就会越来越近。五、Qwen我反而认为它最值得关注“AI操作系统”方向Qwen 的优势与前两者又不一样。它最大的价值可能不是某一个 Benchmark 第一而是模型谱系非常完整。从很小的模型到 MoE、Coding、Vision、多模态、Agent再到图像和视频生态Qwen 更容易形成一个完整的本地 AI Stack。例如 AWS 在 2026 年引入的 Qwen3.5/Qwen3.6 系列已经覆盖多模态视觉推理图片、视频、文本Agent tool useCoding1M context小至 0.8B 的端侧模型面向 Agentic Coding 的高效率 MoE。这意味着 Qwen 特别适合另外一种路线Qwen Large Model ↓ Planner ↓ ┌──────┼──────┐ ↓ ↓ ↓ Vision Code Small Model ↓ ↓ ↓ GUI Tool Local Control ↓ External Models ↓ Image / Video / 3D这已经不像一个模型了。它更像一个开源 AI Runtime 的模型家族。这对于本地 AI 特别重要。六、Astra 真正领先的地方可能不是单项能力因此如果简单总结四条路线我会这样描述路线当前最鲜明的特征下一道题Astra通用智能 Computer Use Agent从操作软件走向构造数字世界DeepSeekReasoning Code Agent强化视觉闭环和环境执行KimiVision Long Context Agent/SwarmVisual Agent进一步工具化Qwen完整开源模型生态建立本地AI Runtime/OS这里最容易被忽略的一点是Astra 的竞争优势未必来自某一个能力特别强而可能来自能力之间已经开始形成闭环。例如一个建筑任务。旧的大模型可能是给你建筑设计建议。再进一步给你生成建筑效果图。而下一代 Agent 应该是理解要求 → 规划建筑 → 操作建模工具 → 建立模型 → 渲染 → 检查结果 → 发现问题 → 修改模型。这时候AI已经不是“Copilot”。而是Operator Designer Reviewer这才是 AGI 概念真正开始进入应用层的地方。七、图形为什么尤其重要我认为未来两三年一个非常值得关注的词不是单纯的 Multimodal而是Spatial / Visual Agency因为语言世界相对简单。语言基本是一维序列Token → Token → Token但现实世界不是。一个三维场景包含Object Position Rotation Scale Material Lighting Camera Physics Animation Relationship TimeAI如果能够理解这些变量并通过软件不断改变这些变量观察结果再重新规划就意味着模型正在获得一种非常不同的能力从生成 Token走向操作 State。而这恰恰也是图形、视频、机器人、自动驾驶、工业数字孪生甚至 Computer Use 最终汇合的地方。八、这对开源 AI 反而是一个机会很多人看到 Astra 后可能得出一个结论闭源模型越来越强开源没机会了。我并不完全认同。因为进入 Agent 时代以后模型本身只是系统的一部分。一个真正可工作的系统可能是Qwen / DeepSeek / Kimi │ ▼ Planner │ ▼ World State │ ┌─────┼─────┐ ▼ ▼ ▼ Browser GUI API │ │ │ └─────┼─────┘ ▼ Execution │ ▼ Observation │ ▼ Verification │ └────────→ Planner真正的竞争开始从Model Intelligence逐渐转向System Intelligence而 System Intelligence 恰恰给开源生态留下了巨大的空间。ComfyUI、Blender、Playwright、FFmpeg、Unreal、CAD、各种 MCP/Skill、Python生态本身就是一个庞大的“AI工具世界”。谁能够让开源模型可靠地理解和使用这些工具谁就可能构建出另外一种 Astra。结语Astra 出的不是一道模型题而是一道系统题所以我认为 Astra 对 DeepSeek、Kimi、Qwen 真正提出的问题不是你们什么时候超过我的 Benchmark而是你们什么时候能够从一个优秀的大脑变成一个能够观察、规划、行动、检查并持续修正的完整智能系统DeepSeek拥有很强的推理底座。Kimi正在积极推进 Visual Agentic Intelligence。Qwen拥有非常完整的开源模型生态。它们都已经拥有这张拼图中的重要部分。但 Astra 让下一阶段的竞争目标变得越来越清晰AI不只是回答世界的问题。AI开始操作数字世界。而当视觉理解、图形生成、软件操作、空间推理和长期规划真正汇合之后我们讨论的可能就不再是“哪个大模型最好”而是“谁最先构建出真正可工作的通用智能系统”这可能才是 Astra 给整个开源模型生态出的一道真正的题
返回列表