ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Ling-3.0-tiny性能评测:25分AAI指数与16分Agentic指数背后的技术密码

Ling-3.0-tiny性能评测:25分AAI指数与16分Agentic指数背后的技术密码 Ling-3.0-tiny性能评测25分AAI指数与16分Agentic指数背后的技术密码【免费下载链接】Ling-3.0-tiny项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tinyLing-3.0-tiny是一款轻量级混合推理MoE模型拥有7.9B总参数和仅1.3B每token激活参数专为在低推理成本下提供强大的推理和智能体能力而设计使高级模型功能更易于在本地和资源受限环境中部署。 核心架构解析效率与性能的完美平衡混合线性注意力架构Ling-3.0-tiny采用3:1交替堆叠的KDA和MLA架构每4层模块包含3个Kimi Delta Attention层和1个多头潜在注意力层结合包含128个路由专家的稀疏MoE FFN。每个token仅激活8个路由专家和1个共享专家使模型在长上下文建模能力、参数效率和计算成本之间取得平衡。原生混合推理能力该模型支持快速响应和多步推理可通过enable_thinking参数按请求配置思考模式。在通用智能体任务、编码、数学和科学推理以及指令遵循方面均表现出均衡性能。 性能表现小身材大能量AAI与Agentic指数成绩Ling-3.0-tiny在Artificial Analysis Intelligence Index v4.1.1上获得25分在Artificial Analysis Agentic Index上获得16分。在Artificial Analysis测试中输出速度超过160 tokens/s500-token响应的端到端延迟约为18秒包括推理时间凸显了其相对于1.3B激活参数占用的效率优势。部署效率与速度专为高效本地部署而设计已在NVIDIA DGX Spark、Apple Silicon MacBook和Mac mini上验证。使用FP8时Ling-3.0-tiny在DGX Spark上达到约100-105 tokens/s在M4 Pro MacBook上达到86-90 tokens/s在8K上下文长度下峰值内存使用约为8.34 GiB。⚙️ 关键技术参数参数数值总参数7.9B每token激活参数1.3B隐藏层大小1536注意力头数16隐藏层数24专家数量128每token专家数8最大上下文长度131072词汇表大小157184 推荐配置与快速启动推荐采样参数temperature1.0top_p0.95top_k20支持的部署框架SGLang提供硬件和特定配方的启动矩阵包含低延迟和高吞吐量配置vLLM需安装支持Ling-3.0的专用分支支持自动工具选择和推理解析器Ollama在Apple Silicon上通过MLX运行已在48GB统一内存的M4 Pro Mac上验证模型文件组成配置文件config.json、generation_config.json架构定义configuration_bailing_moe_v3.py、modeling_bailing_moe_v3.py权重文件model-00000-of-00032.safetensors至model-00031-of-00032.safetensors 总结轻量级智能体的新标杆Ling-3.0-tiny通过创新的混合线性注意力架构和稀疏MoE设计在保持高效推理的同时提供了强大的智能体能力。25分的AAI指数和16分的Agentic指数证明了其在各类任务中的均衡表现而低至1.3B的激活参数使其能够在消费级硬件上流畅运行。无论是本地部署还是资源受限环境Ling-3.0-tiny都为AI应用提供了一个高效且强大的解决方案。要开始使用Ling-3.0-tiny请克隆仓库git clone https://gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny并参考项目中的部署指南选择适合您硬件环境的启动方式。【免费下载链接】Ling-3.0-tiny项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表