它从空文件夹出发,自己写了16天代码 8月初的杭州阿里云大楼里有人给千问的模型团队传了个视频。镜头对准一个几乎空白的文件夹里面只有一条简短的指令创建一个自进化的智能体 Harness。然后屏幕自动开始滚动。16天之后这个文件夹里躺着一个名叫 oh-my-cli 的可运行框架达到 Hermes Agent 级别——整个过程中没有任何一个工程师伸手碰过键盘。这是阿里巴巴千问 Qwen3.8-Max 在8月3日正式上线时抛出的一个演示。2.4万亿参数Qwen 家族迄今最强的模型。官方没有先讲参数怎么堆出来的而是先讲了这样一个没人干预的项目。这个细节比任何跑分数字都更能说明问题。从回答到交付差了整整一个量级过去一年各家大模型的竞争焦点其实一直在悄悄移动。早期比的是谁能答得更准、更全面后来比谁能推理得更深。而到了这一两年门槛变成了一个更硬核的词交付。Qwen3.8-Max 想做的就是把这个词变成现实。官方给它设定了一个有些苛刻的测试场景从一个空文件夹出发自主完成一个需要十数天的真实项目全程无需人工干预。结果它真的做到了——不只是写几段代码而是从需求拆解、技术选型、模块开发到最终交付一整套流程自己跑了下来。另一个演示更贴近普通人的日常。官方说它能把一支法务团队约一周的审阅量压缩到一小时。不管这个数字有没有营销成分它指向的趋势是实在的过去 AI 只是帮人干活现在它开始顶替一整条工作流。这种能力不是刷出来的。千问团队在真实环境和算力上做了联合强化学习RL扩展让模型在数百种高频专业任务里反复试错、迭代。换句话说它不再只是读过很多书而是真刀真枪干过很多活。把200页财报和100小时长视频装进记忆文本能力之外Qwen3.8-Max 在多模态上的动作也值得留意。它能跨页理解200页的财报能把100小时的长视频组织成可检索、可追溯的 Graph 记忆。这背后的思路其实很朴素人类看一份厚厚的年度报告不会从头到尾死记硬背而是在脑子里建一张谁跟谁有关、哪笔钱流到哪的图。千问想做的就是把这种图式记忆给到 AI让它处理长文档、长视频的时候不再抓瞎。更关键的是它在执行中会持续审视自己的中间产物。一旦发现出错了就自己定位、重新规划、修正方向。这有点像人类工程师的代码审查习惯——不是一次性把活干完就结束而是边干边回头看。这听起来像是工程细节但恰恰是它和上一代模型的本质区别上一代模型更像一个回答问题的人它给的是结果新一代模型更像一个能对结果负责的人它会检查和修正。榜单之外真正的信号是什么今天放榜的 Arena 三方榜单里阿里 Qwen 仅次于 Anthropic 的 Claude 系列整体处于全球第一梯队。价格方面也给了个很有竞争力的数国内每百万 Tokens 输入12元、输出36元国际价格约为 Claude Opus 5 的40%和24%。但比榜单和价格更值得注意的是阿里这轮的动作节奏。Qwen3.8-Max 上线的同一天阿里的企业级 Agent 产品千问办公也开启了公测直接集成进这个最新旗舰模型。下周Qwen3.8-Max 的权重还会开源同时开源 Qwen3.8-27B。这释放的信号很清楚模型本身只是地基阿里真正想搭建的是模型Agent开源生态的组合拳。模型负责能想Agent 负责能干活开源负责让更多人基于它长出东西。过去两年关于国产大模型能不能追上海外第一梯队的讨论从来没停过。Qwen3.8-Max 的成绩单给出一个相对明确的回答在模型能力这个维度上差距已经收窄到可以正面对话的程度而在开源、生态和 Agent 落地这些维度上中国企业甚至走得更靠前。回到开头那个空文件夹。它其实是一个很好的隐喻当模型足够强的时候起点是什么并不重要。一个空文件夹、一句指令剩下的交给时间去发酵。16天前那里空空如也16天后那里站着一个能自己持续进化的智能体。这一次敲下第一行代码的不再是人。文中所用图片来源于网络仅供技术学习与交流。如权利人认为存在侵权请联系我们我们将在24小时内处理。