
标题Hunyuan-A13B Technical Report来源arXiv, 2609.27284v1️文章简介研究问题如何在大幅降低计算成本和推理延迟的同时让开源大语言模型保持与超大参数模型相媲美的强大推理和通用能力主要贡献论文发布了Hunyuan-A13B一个总参数800亿但推理仅激活130亿的稀疏混合专家MoE模型通过高质量数据训练和双模式思维链技术实现了高性能与高效率的完美平衡。重点思路采用细粒度MoE架构包含1个共享专家和64个非共享专家每次推理仅激活部分专家在保持800亿总参规模的同时将激活参数控制在130亿显著降低显存占用和计算开销。构建20T token的高质量预训练语料特别强化STEM科学、技术、工程、数学领域数据的清洗与标注为模型打下坚实的逻辑与事实基础并将上下文窗口扩展至256K。实施结构化后训练流程分为“推理导向”和“全场景”两个阶段。先通过监督微调和强化学习提升数学、代码及逻辑推理能力再针对通用对话、创作及多轮交互进行优化确保模型既聪明又好用。创新引入双模式思维链Dual-CoT框架用户可根据需求选择“快思考”模式处理简单任务以追求低延迟或选择“慢思考”模式进行深度多步推理以追求高准确率灵活适配不同应用场景。分析总结在数学和科学推理基准测试中Hunyuan-A13B的表现媲美甚至超越参数量大数倍的密集模型及同类MoE模型特别是在AIME2024等高难度数学竞赛题上取得领先成绩。在Agent智能体任务中表现卓越在工具调用、任务规划及复杂决策场景下优于DeepSeek-R1和Qwen3等强劲对手证明其在实际自动化工作流中的强大潜力。长文本处理能力稳定在RULER基准测试中随着上下文长度增加至128K其性能衰减程度远小于竞品展现出优秀的信息保留与整合能力。推理效率极高得益于MoE架构和GQA技术模型吞吐量显著提升支持多种量化格式非常适合对延迟敏感且资源受限的生产环境部署。个人观点论文通过MoE架构让模型“按需激活”用较小的计算代价换取了巨大的性能收益。双模式思维链设计让模型简单问题快速回答复杂问题深思熟虑。