ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

都说自己是第一,中国最强的大模型到底是谁?

都说自己是第一,中国最强的大模型到底是谁? 中国大模型第一梯队为Kimi K3与Qwen3.8-Max双雄格局。一个较为诚实的表述是中国大模型的第一梯队是Kimi K3与Qwen3.8-Max组成的双雄格局。前者赢在国际验证后者赢在中文综合与生态。当前中国大模型行业出现了一个奇观几乎每一家头部公司都声称自己的模型是“中国第一”甚至“全球前三”。阿里说Qwen3.8-Max“第三方盲测仅次于Claude”月之暗面说KimiK3是“全球最强开源模型”智谱说GLM-5.2“Code Arena全球第一”DeepSeek的模型卡上写着“SWE-bench Verified 80.6%”字节的豆包2.1宣称“IMO金牌、HLE全球领先”百度文心5.0强调“10M上下文、中文写作第一”。这些说法都“对”但都不完整。它们有一个共同特征每个“第一”前面都有一个精心挑选的定语。参数最大是第一某个单项基准是第一某个盲测榜是第一某个价格档是第一。定语不同结论自然互不冲突。就像智能手机年代每家厂商都说自己“跑分第一、拍照第一、续航第一”也像新能源汽车每家都说“续航第一、智驾第一、安全第一”。大洋彼岸的情况不同。美国大模型行业存在一个相对公认的格局某个阶段OpenAI领先某个阶段Anthropic的Claude领先Google的Gemini在中间穿插反超2026年年中的共识是Anthropic重新领跑Claude Fable 5在Artificial Analysis智能指数上以约60分排第一GPT-5.6 Sol以约59分排第二。这个共识由第三方评测机构、开发者社区和真实使用数据共同投票形成不需要看任何一家公司的发布会。中国没有形成这种共识。不是因为没有答案而是因为答案被公关宣传的声浪盖住了。这促使我们抛开所有公司自己的说法主要采用三类最权威的第三方验证数据Arena全球盲测、Artificial Analysis智能指数与SuperCLUE中文测评来进行交叉对照看事实到底支持什么结论。第一条证据链Artificial Analysis智能指数Artificial AnalysisAA是国际开发者社区引用最多的独立评测机构它的智能指数综合了数学、推理、代码、知识等多个维度的标准化测试全球189款模型同台排名。它不收厂商的钱测试口径统一是目前最接近“客观”的第三方标尺。截至2026年8月初中国主要模型在AA智能指数上的成绩是月之暗面KimiK3Max57分189款模型中排第四。这是开源权重模型有史以来的最高排名超过了Claude Opus 4.8约56分仅次于Claude Fable 5约60分、GPT-5.6 Sol约59分和谷歌的一款旗舰。智谱GLM-5.2Max51分排在十名开外。深度求索DeepSeekV4 Flash 073150分与谷歌Gemini 3.6 Flash持平。阿里Qwen3.8-Max暂无成绩。 截至目前AA尚未完成对它的评测。其上一代Qwen3.7-Max的验证成绩是56.6分——这是该家族唯一的第三方参照。这张表透露了两件事。第一中国最强的模型已经摸到了全球第一梯队的门槛KimiK3的57分与榜首的差距是3分而一年前这个差距是两位数。第二“官方最强”与“验证最强”是两回事——声称“仅次于Claude Fable 5”的Qwen3.8-Max恰恰是头部模型中唯一还没有第三方成绩的。第二条证据链Arena盲测Arenaarena.ai的机制是人类盲测两个匿名模型回答同一个问题用户投给更好的那个数百万张投票换算成ELO积分。它衡量的不是“考多少分”而是“真人觉得谁更好用”。2026年8月第33周8月10日-16日的榜单国产模型的成绩如下。在综合榜中Anthropic的Claude系列包揽前五。国产模型中Qwen3.8-Max排第8ELO 1491KimiK3 Max排第121489是仅有的两家进入前十五的中国模型。这个格局值得细看两家分差只有2分在误差范围内基本并列但Qwen3.8-Max的位置更靠前。在代码榜中KimiK3 Max排第61544分是排名最高的国产代码模型Qwen3.8-Max排第13小米Mimo排第25。前端开发榜是国产模型表现最突出的一个榜单。KimiK3 Max以1674分排第2仅落后榜首的Claude Opus 5 Max1692分18分Qwen3.8-Max排第31667分智谱GLM-5.2-Max排第9DeepSeekV4 Pro新入榜即排第10。而一个月前KimiK3刚发布时曾以1679分短暂登顶这个榜单那是国产模型第一次在Arena的实战榜单上拿到全球第一。智能体榜中KimiK3 Max以10.60%的净提升度排第5与Claude Opus系列同处全球第一梯队Qwen3.8 Max新入榜排第11GLM 5.2 Max排第14DeepSeekV4 Flash排第19。把四张榜单放在一起看结论清晰。在Arena的体系里KimiK3 Max是中国模型中覆盖面最广、位置最高的那个——代码第6、前端第2、智能体第5、综合第12没有一项掉出前十五Qwen3.8-Max则是综合榜上位置最高的国产模型第8但在代码、智能体两个实战榜单上落后于Kimi。第三条证据链SuperCLUE中文测评SuperCLUE是中文场景下最具公信力的第三方基准之一。2026年7月的榜单上12款国产主流模型的综合总分排名是Qwen3.8-Max、Kimi-K3、豆包Doubao-Seed-2.1-Pro与DeepSeek-V4-Flash。第一和第二的分差很小但顺序明确。在中文综合能力上阿里的Qwen3.8-Max排第一。 这与它在Arena综合榜第8高于Kimi的第12的表现互相印证。值得注意的是第三、第四名。字节豆包2.1-Pro在中文综合测评中排第三是“五强”中唯一没有参加Arena国际盲测的模型它的能力在国内榜单可见在国际坐标系里缺失。DeepSeek排在第四它曾经的领跑者位置已经让给了后来者。编程专项上SuperCLUE给出了另一个答案。GLM-5.2以64.13分断层领先KimiK2.7-Code得55.43分。智谱是一家典型的“偏科生”单项编程全球第一它还在国际Code Arena和Design Arena上拿到过第1综合能力却排不进国内前四。五家画像各强的维度在逐一画像之前先把五家旗舰的硬规格放在一起因为2026年夏天是这五家在六周内密集发布前沿模型的第一个夏天6月中旬智谱GLM-5.27月16日KimiK37月19日Qwen3.8-Max预览7月27日KimiK3开源7月31日DeepSeekV4 Flash 07318月3日Qwen3.8-Max正式版。三个事实值得注意。第一百万token上下文已经是旗舰标配不再是差异点——五家全部支持。第二2万亿参数级的模型全部选择开源MIT协议这是中国公司对全球开源社区的集体贡献也是对美国闭源路线的差异化竞争。第三同为旗舰输出价格差了50倍——这个价差本身就是商业模式的选择KimiK3用最贵的价格匹配最强的推理密度DeepSeek用地板价换取Agent高频调用市场。把三条证据链交叉对照2026年8月中国大模型五强的真实位置可以这样描述。月之暗面KimiK3验证维度上的中国第一。7月16日发布7月27日开源2.8万亿参数、104B激活是人类历史上参数规模最大的开源模型也是全球第一个原生支持文本、图像、音频、视频四模态的万亿级开源模型。它的第三方成绩单是所有国产模型中最完整的AA智能指数57分开源史上最高、全球第4、超过Claude Opus 4.8Arena前端第2、代码第6、智能体第5SuperCLUE中文第二。第三方评测机构FireworksAI在1030个真实Agent任务上的实测显示KimiK3的表现接近Claude Fable 5成本约为其1/50。短板是贵输出定价100元/百万token是DeepSeekV4 Flash的50倍。阿里Qwen3.8-Max中文综合与生态上的第一。2.4万亿参数、95B激活8月3日正式版发布。它是SuperCLUE中文综合第一、Arena综合榜国产最高第8。但必须指出它的国际验证成绩单目前是空白的。AA智能指数未评测官方基准电商模拟4.16倍回报、16天自主编程265次提交等全部来自阿里自己。它真正的护城河在别处Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚这是其他四家都没有的资产。深度求索DeepSeekV4是推理与性价比之王但已被反超。2025年初DeepSeekR1以极低的训练成本逼近当时OpenAI的顶级模型在硅谷引发震动英伟达当天股价大跌全球第一次正视中国大模型。那是DeepSeek的高光时刻也是中国大模型行业的高光时刻。此后一年半DeepSeek的节奏慢了下来V4今年4月24日发布中间四个月没有重磅更新7月31日的V4 Flash 0731和8月中旬的V4 Pro更新才重新回到牌桌。它的底子仍在——8月中旬一项对8款主流模型的独立横评API实测中DeepSeekV4 Pro以9.1分排在所有国产模型之首全场仅次于Claude Opus 4.89.20推理单项9.5分超过GPT-5.6“识别条件不足、知道何时不该下结论”的能力被评为全场最强SWE-bench Verified约80.6%是国产模型中可查证的最高标准化跑分。V4 Flash284B/13B激活把输出价格压到2元/百万token约为Claude Opus的1%是Agent高频调用场景的默认选项。但它的AA智能指数是50分综合排名已被KimiK357和Qwen3.8-Max甩开从2025年的全球领跑者变成了2026年的追赶者。这个故事本身是中国大模型竞争烈度的注脚在这个行业停止迭代一个季度就可能从第一梯队掉队。智谱GLM-5.2编程特长生。约744B参数MIT开源基于华为昇腾训练这在2026年的语境里有特殊的战略意义。它在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第1SuperCLUE编程专项断层领先。但综合能力AA 51分、Arena智能体第14与第一梯队有明显差距独立横评中它的推理任务表现甚至出现过翻车。字节豆包2.1-Pro用户规模第一国际验证缺位。SuperCLUE中文综合第三响应速度全场最快首字延迟约380毫秒背靠豆包App国内最大的AI用户盘子。字节内部正在推进五万亿参数超大模型的前期论证。但它缺席Arena国际盲测AA指数也查无此模型。一个不在国际考场出现的考生无法参与“全球坐标”的排名。直接回答这个问题三条证据链摆完可以正面回答“中国最强的大模型到底是谁”了。如果以第三方验证的完整性和强度为标准答案是月之暗面的KimiK3。它是目前唯一一个在所有主流国际评测体系中都有成绩、且成绩全部进入全球前列的中国模型AA智能指数57分排全球第4这是中国模型乃至所有开源模型的历史最高位Arena四个实战榜单三项国产第一、一项前三FireworksAI实测接近Claude Fable 5。它是全球开发者社区用脚投票选出来的中国冠军——在Hugging Face上2.8T的KimiK3开源当天即登顶趋势榜。如果以中文综合能力为标准答案是阿里的Qwen3.8-Max。SuperCLUE总分第一Arena综合榜国产最高。它在中文语境下的综合表现目前没有对手加上Qwen家族全球第一的开源生态它是产业渗透角度的隐形第一。但需要保留一个判断它的国际标准化成绩单还空着官方“仅次于Claude Fable 5”的说法目前属于“厂商主张”等待第三方验证。所以最诚实的表述是中国大模型的第一梯队是一个双雄格局KimiK3与Qwen3.8-Max前者赢在国际验证后者赢在中文综合与生态。两者身后DeepSeekV4、GLM-5.2、豆包2.1-Pro构成第二梯队分别在推理、编程、用户规模上各握一张单项冠军的牌。这像极了2026年全球格局的中国版美国是Anthropic与OpenAI的双雄60分与59分中国是月之暗面与阿里的双雄57分与待验证。真正的差距在第三名之后美国的第三名谷歌与国际前二的差距远小于中国第三名与前二的差距。对普通使用者而言这个结论可以再翻译得直白一些。按场景选比按“谁最强”选更接近最优解。写代码、做前端、跑AgentKimiK3是当前国产验证成绩最好的选择中文写作、超长文档、综合办公Qwen3.8-Max更稳高难度推理和数学DeepSeekV4 Pro的实测表现仍是国产最强预算敏感的高频调用DeepSeekV4 Flash的性价比没有对手要本地部署、数据不出内网可选开源的KimiK3、GLM-5.2或Qwen家族。“没有全能王组合使用优于单押一个”——这是那项独立横评的结论也是大多数深度用户的真实用法。“人人第一”是怎么造出来的回到开头的问题为什么中国会出现“每家都第一”的乱象拆开看每家的说法在技术上都不算撒谎它们只是选择了对自己最有利的坐标系。阿里说“盲测仅次于Claude”用的是Arena综合榜第8前面的7个里有5个是Anthropic和谷歌的模型国产中确实是最高的月之暗面说“全球最强开源”——用的是参数规模和AA指数在开源这个类目里确实第一智谱说“全球第一”用的是Code Arena编程单项确实第一过DeepSeek说“SWE-bench 80.6%”用的是单一标准化基准确实可查证字节说“金牌、全球领先”用的是竞赛成绩和自建基准HLE-Text 54.2分确实是该基准的最高分但该基准样本极少。这套话术的完整公式是换一个坐标系就换出一个第一。坐标系可以按能力维度切推理、代码、写作、多模态按语言切中文、英文按规模切开源、闭源、万亿级、百亿级激活按价格切同价位最强甚至按硬件切国产芯片训练的最强。切法是无穷的第一也是无穷的。美国行业也存在营销但压制营销的是两股力量。一是Artificial Analysis、Arena这类成熟第三方评测机构的存在它们的榜单被投资人和企业采购方当作决策依据厂商绕不过去二是开发者社区的舆论场一个模型发布后几小时内就会在开源社区和社交媒体上被真实任务检验名不副实的宣称存活不了48小时。中国的评测基础设施SuperCLUE、OpenCompass等正在补齐但公关宣传的音量仍然大于榜单的音量。一个可以参考的判断习惯是看任何一个“第一”的宣称先问三个问题。这个第一是在哪个坐标系里这个坐标系是谁定义的同一坐标系里排第二第三的是谁三个问题问完大部分“第一”会自动现出原形。差距与时间窗最后说一个容易被发布会掩盖的事实中国第一与世界第一的差距目前是3分AA指数57对60但这个数字背后的差距比看起来大。KimiK3超过的是Claude Opus 4.8——Anthropic的上一代模型。它面对的Claude Fable 5、GPT-5.6 Sol以及Anthropic在8月密集发布的多款opus-4系列新模型仍在快速迭代。Arena第33周的榜单上综合榜前五名全部是Anthropic的模型这个集中度本身就是差距的体现。但另一面同样成立中国模型从“落后一个身位”到“3分之差”只用了一年半。2025年初DeepSeekR1让全球第一次正视中国模型2026年年中Kimi K3成为全球前五中唯一的非美国模型、并且是开源的。在开源这个半场格局甚至已经反转全球最强的开源权重模型Kimi K3、下载量最大的开源家族Qwen、生态最活跃的开源社区全部在中国。这场追赶背后还有一个不太出现在排行榜上、但决定长跑胜负的变量算力。GLM-5.2基于华为昇腾训练是首个在国际榜单登顶的国产芯片训练模型DeepSeek的架构设计从V3开始就以“单位算力产出最大化”为第一原则用稀疏激活和算法优化把成本压到同行难以理解的水平Kimi K3和Qwen3.8-Max的万亿级训练同样完成于国产算力占比持续提升的集群之上。在美国对高端GPU出口持续收紧的背景下中国大模型的这轮进步是在算力约束下取得的这意味着它不是靠堆资源堆出来的峰值而是效率创新的产物。效率优势的缺点是天花板可能更低优点是可持续、可复制。还有一个维度的差距常被忽略商业模式与生态。Anthropic与OpenAI的领先不只是模型分数还有Claude Code、ChatGPT这类被全球开发者每天高强度使用的终端产品形成的真实数据飞轮。中国模型在API与开源生态上进展极快但全球级别的终端产品还没有出现豆包的用户盘子主要在国内Kimi和Qwen的海外用户仍以开发者为主。分数可以三个月追平产品与生态的差距需要更长时间。所以“中国最强的大模型是谁”这个问题的完整答案还应该加上一层时间维度。按当下的第三方验证是Kimi K3按中文综合与产业生态是Qwen3.8-Max而三个月后这个答案可能就要重写Qwen3.8-Max的AA评测、DeepSeek的下一代、字节的五万亿参数模型与智谱的下一版模型都在路上。这不是和稀泥。模型行业的一个基本事实是领先窗口以月计算。2025年初是DeepSeek R1的时刻2026年年中属于Kimi K3和Qwen3.8-Max。真正不变的结论只有一条能被全球第三方榜单反复验证的那个名字才是当下真正的第一。到今天为止这个名字是Kimi K3。下一个是谁让榜单说话而非听各个大模型厂自说自话。原文链接都说自己是第一中国最强的大模型到底是谁-36氪
返回列表