
Kimi K2 速览MuonClip 优化器如何稳住 1T 参数 MoE 的预训练【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2Kimi K2 是 Moonshot AI 发布的混合专家MoE语言模型系列总参数 1T、激活参数 32B。其预训练全程采用 MuonClip 优化器在 15.5T tokens 上保持零训练不稳定并针对工具调用与智能体任务做了专门优化。 为什么 1T 参数 MoE 需要专门的优化器MoE 结构将参数拆入 384 个专家单 token 只路由 8 个这让 1T 总参数的推理成本接近 32B 稠密模型。但 Muon 这类动量正交化优化器被推到 1T 规模时梯度更新幅度的漂移会随参数规模放大长周期训练极易出现 loss 尖峰。Kimi K2 的预训练预算为 15.5T tokens任何一次不稳定都可能打断整条训练稳定性因此成为先决条件。 MuonClip 优化器原理规模化下的稳定化改造MuonClip 解决什么问题、达到什么效果把 Muon 优化器应用到前所未有的规模直接支撑 1T 参数 MoE 完成 15.5T tokens 预训练针对扩展过程中暴露的不稳定性配套开发了一组新的优化技术最终实现零训练不稳定稳定的长周期训练换来一致的收敛曲线模型在知识、推理、编码与工具调用上均进入第一梯队 1T 参数 MoE 架构一览Kimi K2 参数速查分组配置项数值规模总参数 / 激活参数1T / 32B规模层数含 1 层密集层61注意力隐藏维度 / 头数 / 机制7168 / 64 / MLA专家路由专家总数 / 每 token 选中数 / 共享专家384 / 8 / 1专家路由单专家隐藏维度2048基础配置词表大小 / 上下文长度 / 激活函数160K / 128K / SwiGLU Kimi K2 部署步骤克隆仓库git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2权重以 block-fp8 格式发布可从 Hugging Face 的 moonshotai/Kimi-K2-Instruct 页面获取推理引擎建议选用 vLLM、SGLang、KTransformers、TensorRT-LLM 之一vLLM 与 SGLang 的启动示例见 模型部署指南工具调用流程参考 工具调用指南官方推荐 sampling 温度取 0.6写在最后Kimi K2 把优化器工程沉淀为可复现的方法MuonClip 证明 1T 参数 MoE 能在 15.5T tokens 上稳定走完预训练Base 版本保留全量微调自由度Instruct 版本可直接用于对话与智能体场景。更多训练细节可查阅仓库中的 技术报告全文官方 Tech Blog 也提供了对应的解读。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考