ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeepSeek把6个基础组件开源给昇腾:国产算力的软件底座补上了多少

DeepSeek把6个基础组件开源给昇腾:国产算力的软件底座补上了多少 9月30日DeepSeek 宣布开源一套面向华为昇腾Ascend算力平台的基础设施组件涵盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。据多家媒体报道这批组件与 DeepSeek 此前给英伟达平台开源的组件一一对应。这条新闻没有发布新模型那么抓眼球所以热度不算高。但对做大模型训练或推理部署的人来说它可能是近期最值得看一眼的技术事件之一——因为它动的是地基不是外墙。这次到底开源了什么据公开信息这次放出来的不是能直接聊天的产品而是大模型跑起来时底层要用的零部件大致按功能可以分成这几类TileLang昇腾版高级语言编译工具。对昇腾 Ascend C 底层指令做封装让开发者用更接近高级语言的方式写算子官方称不损失硬件性能。DeepGEMM通用矩阵运算加速管算。DeepEP大规模跨设备通信主要服务专家并行EP等场景管搬数据。TileKernels常规向量计算和访存算子。FlashMLA稀疏注意力算子用于提升长上下文处理效率。DeepSelect高效的数据筛选。一句话概括矩阵运算、跨卡通信、注意力计算——这几段最吃性能的路在昇腾上被重新铺了一遍。技术本质是铺路不是搬家这里有个容易被带偏的点不少人第一反应是国产版 CUDA 来了。据报道实际情况没这么夸张。CUDA 的价值不只是一套底层指令而是二十年积累的框架、算子库、教程、社区以及无数踩过的坑。这次开源更接近的做法是把大模型训练里最吃紧的那几段路在两套硬件上用同一套接口重新实现。据技术社区的分析几个组件里一部分是在原有跨平台项目上新增了昇腾后端另一部分是新仓库但接口与英伟达版本保持对齐——上层调用几乎不用改。这才是一一对应真正落地的地方。和之前比变的是昇腾生态过去比较薄弱的高性能算子库和编译工具链开始由头部模型团队来补而且是模型团队把自己训练里用脚投票写出来的代码直接开源不只是芯片厂商单方面做适配。没变的是CUDA 生态仍然是绝大多数人的默认起点算子覆盖度、工具链成熟度、文档和社区支持依旧是迁移时绕不开的门槛。涉及的工程细节与数据据报道这次合作还涉及昇腾 950 机型的 128 卡超节点方案。华为方面提供的组网方案包含 SuperPoD Flex 与 UBL128可实现 128 卡 3.2Tbps 单层交换的 Scale-up 网络以及 256K 卡两层交换的 Scale-out 网络并提供 ASC-COMM 通信编程库。在通信性能上据报道 DeepEP 实测达到 Dispatch 375 GB/s、Combine 347 GB/s接近硬件上限。通信为什么重要因为单卡再快如果数据不能及时到达下一步计算所在的卡整个任务还是得等。对开发者意味着什么如果是做大模型训练、推理部署的工程团队这条新闻确实和你有关但建议按下面的节奏来先读文档别急着上生产。新开源的组件文档成熟度和边界情况处理通常需要时间打磨。做小规模验证。挑一个非关键的业务或研究任务先验证算子覆盖是否满足你的模型结构。盯住算子缺失和工具链。社区里比较一致的建议是等商用工具链更齐全再做生产级验证。别把开源了等同于能直接替换。接口对齐降低了迁移成本但性能调优、故障排查的经验还得自己积累。从岗位角度看还有一层影响国产算力适配会带来新的工程需求比如算子调优、跨平台迁移、性能对齐。对做运维、平台、算法的同学来说这可能是接下来一段时间新增的技能点。结尾昇腾的软件生态短板正在被一点点补上但离能无痛替换还有距离。你所在的公司会愿意为国产算力提前做技术储备还是继续观望你怎么看评论区聊聊。
返回列表