ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-6 震撼发布!人类进入 AGI 大分工时代

GPT-6 震撼发布!人类进入 AGI 大分工时代 就在刚刚OpenAI 官方定调称这是「全球最智能、最符合人类意图的模型」。OpenAI 表示Astra 集合了多年在预训练、强化学习和模型对齐领域的研究成果在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作等多个方向达到新的能力水平。相比以聊天、写作和问答为主的前代模型Astra 更像一个能直接干活的 AI Agent它可以调用工具、操作软件、浏览网页独立完成复杂任务。这一次发布也成为 OpenAI 近年来规模最大的一次模型升级。据 OpenAI 研究负责人 Aidan Clark 介绍Astra 是 OpenAI 迄今规模最大的训练项目之一也是首次在训练过程中大量使用此前模型参与监督的新一代模型。该模型首次在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。OpenAI 总裁 Greg Brockman 更是直接开麦几年后回头看今天就是 AGI 时代的起点。GPT-6 Astra 登场要让 AI 接管软件GPT-6 Astra 最大的变化是 Computer Use 能力。过去的大模型虽然可以生成代码、总结资料、回答问题但真正进入现实软件环境执行任务时仍然存在明显限制。浏览网页、填写表格、操作办公软件、处理复杂流程这些任务需要大量人工介入。Astra 试图改变这一点。OpenAI 称Astra 是目前最强的计算机操作模型可以完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究并在邮件和文档编辑器中生成内容。它还可以分析科学数据、生成图表、创建网站并自动运行前端质量测试。在官方演示中Astra 展示了多个接近真实工作的创意场景。它可以使用 KiCad 完成 PCB 设计将电子原理图转换成可以制造的电路板布局可以操作 Excel、Power BI 等办公工具可以使用 Blender 创建三维模型并进一步转换为 Unreal Engine 5 中可交互浏览的空间。除此之外我们还能让 Astra 从设计图开始搭建完整房屋模型模型先在 Blender 中完成 3D 建模再自动导入 Unreal Engine 5生成可以自由探索的交互场景。甚至另一位用户还能通过 MCP 连接 Ableton让 Astra 从零制作完整音乐包括音色设计、乐器编排和混音流程。基准测试结果也显示Astra 的 Computer Use 能力明显提升。在 OSWorld 2.0 测试中GPT-6 Astra 得分达到 72.6%高于 GPT-5.6 Sol 的 65.7%。而在 Agents Last Exam 测试中Astra 得分达到 59.3%高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。此外OpenAI 还同步升级了 Codex harness。过去AI 编程 Agent 最大的问题之一是长时间任务容易丢失上下文。一个持续数小时的大型开发任务中模型可能忘记此前为什么修改某段代码或者遗漏用户早期提出的限制条件。Astra 引入了新的上下文管理方式。OpenAI 表示Codex 不再单纯依靠压缩总结保存历史而是可以跨上下文窗口保存笔记并搜索此前消息和工具输出从而找到之前的需求、测试结果以及修改记录。同时Astra 可以在等待用户回复时继续推进不依赖该信息的任务。如果问题会影响最终结果模型会等待用户确认如果影响较小则会根据合理假设继续执行。简言之过去人们更关注模型能否给出准确回答接下来真正拉开差距的将是它能否独立完成一项完整工作。代码、数学和科学成为 GPT-6 Astra 的新战场OpenAI 希望 Astra 不只是一个效率工具而是进入企业核心工作流程。其中软件工程是竞争最激烈的领域之一。OpenAI 将 Astra 称为目前最强的软件工程模型。在考察终端环境测试的 Terminal-Bench 4.0 中Astra 得分达到 57.7%明显高于 GPT-5.6 Sol 的 37.3%同时每个任务的预计 API 成本低于 Sol 和 Claude Fable 5.1。在 DeepSWE v1.1 测试中Astra 得分达到 74.1%。OpenAI 更强调的是Astra 在复杂真实开发环境中的表现。合作伙伴 Jane Street 表示Astra 在 Agent 编程场景下更容易被开发者理解同时生成代码需要更少迭代才能达到生产质量。ARC-AGI-3 的得分达到 99.9%AI 创作者 Pietro Schirano 则展示了 Astra 根据图片生成 3D 模型和动画并通过一句目标指令创建完整水下探索游戏的过程其中包含 3D 元素、声音以及可交互玩法。另一位用户 Chris 表示Astra 在 Unity 环境中的表现相比此前版本提升明显能够直接利用现有资源组装城市场景生成更接近真实游戏开发流程的内容。科学研究则是 Astra 展示能力的另一个重点。OpenAI 表示Astra 在 FrontierMath Tier 4 测试中取得 97.6% 成绩在 GPQA Diamond 科学推理测试中达到 96.0%。这款新模型还参与了数学研究。OpenAI 表示Astra 帮助推进了素数间隔问题研究其中一项结果将无限多个素数对之间的已知距离上限进一步缩小。在实际科研流程中Astra 不只是回答科学问题而是可以直接进入专业软件环境分析数据。例如它可以检查基因测序质量、分析遗传变化并帮助研究人员判断下一步研究方向。不过Astra 最受关注的能力也带来了最大的安全争议。OpenAI 表示Astra 已达到其 Preparedness Framework 中的「关键网络安全能力阈值」。在 ExploitBench 测试中Astra 获得 100% 成绩高于 GPT-5.6 Sol 的 78.5%在 ExploitGym 测试中Astra 成功率达到 42.4%高于 Sol 的 30.3%。进一步测试显示Astra 在近期漏洞测试中发现并利用了两个此前未知的 zero-day 漏洞OpenAI 表示已经向相关维护方披露。同一个模型既可以帮助企业发现漏洞、修复代码也可能被用于攻击系统。因此 OpenAI 对 Astra 的开放采取了更严格的分级策略。普通用户版本会拒绝部分高级网络安全请求而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。人类与 AI 的大分工时代GPT-6 Astra 发布后AGI 再次成为行业讨论中心。OpenAI 并没有正式宣布已经实现 AGI但 Greg Brockman 的表态明显更加积极。他认为未来的人们可能会把 Astra 看作 AGI 时代的重要起点同时表示 AGI 更像一个「使命概念」而不是一个可以被简单定义的技术指标。「如果几年后回头看什么时候真正创造了 AGI我认为可能就是现在可能就是这个模型。」Brockman 如此表示。而在此次 Astra 发布的过程中OpenAI 也特别强调「对齐」。OpenAI 表示Astra 是目前最符合人类意图的模型。在一项测试模型是否会突破任务边界的评估中GPT-5.6 Sol 在没有生产防护措施时越过授权范围的比例为 48%而 Astra 为 0%。这一变化与此前 AI 安全事件密切相关。此前 OpenAI 测试中的 AI Agent 曾出现突破限制环境并攻击 Hugging Face 相关系统的事件引发行业对于 AI 自主行为边界的担忧。Astra 发布时OpenAI 试图证明它已经建立了更完善的安全机制。但另一面的问题是OpenAI 承认测试显示 Astra 的文字推理过程相比 GPT-5.6 Sol 更难监控。究其原因Astra 能够使用更少的文字步骤完成复杂任务。商业化方面Astra 也进入更高价格区间。GPT-6 Astra 将首先向 OpenAI Daybreak 项目的部分企业用户开放随后向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放并通过 OpenAI API 和 AWS 提供服务。API 定价为输入每百万 token 10 美元输出每百万 token 50 美元缓存读取和写入另有计费规则。同时OpenAI 还提供 Fast Mode可以将处理速度提升至标准模式的 2.5 倍但价格也会上升至标准模式的两倍。相比 GPT-5.6 SolAstra 的价格有了明显提升。不过OpenAI 认为未来企业不会只关注 token 单价而会关注完成一次任务需要付出的总成本。Greg Brockman 更是表示AI 行业最终需要从「token 定价」转向「任务成本」衡量。虽然 OpenAI 说 GPT-6 Astra 接近开启了 AGI 时代。但真正值得关注的或许不是 AGI 这个标签而是我们已经清晰地看到 AI 开始接近一种新的存在形态它不再等待人类拆解任务而是开始理解目标、制定路径并主动完成工作。蒸汽机改变工业时代时人们看到的是一台机器互联网改变世界时人们看到的是一张网络。只有多年以后人们才意识到它们改变的其实是整个社会运行方式。从这个角度看Astra 的意义并不只是一次模型升级。当 AI 开始进入办公室、实验室和代码库人类与机器的关系也将迎来一次重新分工届时我们也将需要重新思考自己的价值所在。
返回列表