ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

阿里刚刚开源Qwen-3.8 Max,媲美GPT-5.6 Sol、Claude Fable 5

阿里刚刚开源Qwen-3.8 Max,媲美GPT-5.6 Sol、Claude Fable 5 大家期待的Qwen-3.8 Max刚刚开源了一共有2.4万亿参数性能媲美GPT 5.6 Sol、Claude Fable 5等顶尖闭源模型。开源地址https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B超强代码能力先说说Qwen-3.8 Max在代码开发方面的表现吧这部分确实让人有点惊讶。现在顶级的代码模型早就不是帮你写个函数那么简单了这次千问直接让它去从零搭建完整的、需要好几天才能完成的项目而且全程没有人介入。第一个案例挺有意思的他们让Qwen3.8-Max从零开始搭建一个叫oh-my-cli的命令行工具框架让它连续自主编码超过十天。这个框架能把用户反馈、社区开发规范和模型自测结果整合成一个完整的工程闭环。就是先把需求标准化成GitHub工单然后让智能体自动认领任务通过代码迭代、自动化测试、预览验证和日志记录不断优化功能。整个项目全程都是AI自己在跑没有人碰过一根手指头。到7月30号的时候这个仓库已经产生了265次代码提交、127个合并PR和151条需求工单。第二个案例就更硬核了。他们给Qwen3.8-Max一篇关于大模型推理统一数据筛选的论文让它从零复现全部实验代码还要自主优化算法效果。这个论文解决的是AI训练的一个老大难问题就是当训练数据量远远超过硬件能承载的上限时怎么筛选出真正有价值的训练样本。Qwen3.8-Max自己跑了大概五天累计125小时不间断运算手写了大约7600行代码执行了1100多次操作完成了33轮GPU训练。前37个小时它从零搭建了完整的实验流水线完整复现了论文的六个核心结论还多次微调了Qwen3-8B模型在高难度的AIME24数学基准上验证原文的筛选方案比随机采样提升了7.7%的准确率。后面的88个小时就更厉害了开启了一个自主迭代的科研闭环提出假设、编写代码、GPU训练、分析结果、迭代优化自主设计了18种改进思路分四轮验证每一轮的实验结果都作为下一轮假设的依据最后竟然演化出了全新的筛选算法。第三个案例也很有说服力他们让Qwen3.8-Max独立参加阿里云天池平台举办的WWW2025多模态对话意图识别挑战赛。这次比赛有526支人类队伍参加任务是要结合客服聊天文本和截图精准识别客户的真实诉求。限制很严格24小时限时全程无人工协助模型要自己研读赛事规则搭建完整的解决方案。Qwen3.8-Max构建了文本和图片两个分支文本分支微调集成了BERT、MacBERT、RoBERTa多款中文大模型图片分支微调了Qwen2.5-VL-7B视觉语言模型还用Chinese-CLIP处理主模型识别模糊的图片。最后还构建了一个加权投票融合系统通过交叉验证校准各模型权重额外增加图像模型来打破预测平局。整个过程累计提交了45次每一轮的结果反馈都指导下一轮的微调与权重优化准确率从0.60一路稳步提升到0.853超过了526支人类队伍中的458支占参赛总人数的87%。这意味着在24小时无人介入的情况下一个AI模型能击败接近九成的人类团队。多模态能力也很突出多模态这块Qwen3.8-Max 把视觉能力从输入阶段延伸到了全流程。什么意思呢就是它边干活边看自己干得怎么样发现问题就自己改。比如生成一个三维室内场景会持续检查电视模型朝向对不对、界面元素有没有错位、光线和阴影效果符不符合预期。更实用的可能是文档和视频处理能力。两百页以上的复杂财务 PDF模型能把文字、图表、版式一块儿解析了输出结构化报告甚至可直接上线的网页。上百小时的长视频不是简单定位片段回答问题而是构建整个视频的记忆图谱把人物、事件、时间戳、场景全串起来你可以像查资料一样去检索视频里的任何细节。无论是专业文献、完整剧集还是直播录像碎片化的信息会被整理成可交互的知识体系这个用法在真实工作场景里价值巨大。实测数据测试数据方面Qwen-3.8 Max与GPT 5.6 Sol、Claude Fable 5等顶尖闭源模型做了全方位对比涵盖代码开发、智能办公、专业推理、多模态处理等数十个评测维度数据结果非常亮眼。在最核心的科研论文复现评测中它拿到93分的高分大幅领先前代模型和多数竞品。代码开发、安卓应用开发、前端项目搭建、矢量绘图等工程类任务的得分全部实现大幅提升。日常办公、职业全流程任务、工具调用、全网检索等通用能力均衡且能打没有明显短板。专业领域的表现同样出色法律问答、金融研报、医疗问答、长文档检索等细分场景得分均高于前代版本中文场景适配优势格外突出。在超长文本理解、高阶逻辑推理这类基础能力上也保持着行业顶尖水准。尤其是多模态相关的视觉推理、视频理解、三维建模、网页开发能力多项指标超越海外旗舰模型。
返回列表