
标签# 国产 AI 算力 #PCIe5.0 #超节点 #交换芯片 #AI 服务器 本文为技术分析文章基于 WAIC2026 行业观察与硬件工程实践展开不构成选型采购建议。0 前言2026 世界人工智能大会WAIC2026上国产算力产业呈现明显趋势行业竞争已经从单颗 AI 芯片峰值算力比拼转向超节点、系统级互联的综合能力比拼。海光、沐曦、壁仞、摩尔线程等厂商密集迭代算力硬件国产 AI 芯片市场占比突破 50%国内智能算力规模持续扩张。传统简单堆叠加速卡的方案正在暴露短板CPU 原生 PCIe 通道数量有限多 NPU、高速 NVMe 存储、高速网卡同时接入时容易出现通道瓶颈、带宽不足、跨设备交互时延高的问题也就是行业常说的互联墙问题湖北省人民...。超节点通过高速互联把大量加速单元聚合为统一算力矩阵但不同层级硬件对互联器件的需求并不相同。在整个算力矩阵的硬件链路中PCIe 交换芯片承担 CPU、NPU、网卡、存储之间数据调度的角色。IX9104 作为国产 PCIe5.0 交换器件在国产算力建设浪潮中在中高密度推理集群、私有化行业算力等场景形成差异化的工程落地机会。1 WAIC2026国产超节点的技术现状与硬件痛点WAIC2026 集中展出多款国产超节点方案不同厂商路线各有侧重大规格训练超节点依靠厂商私有高速互联面向万亿参数大模型训练单超节点支持数百至上千卡规模主打大规模智算中心场景。解耦式超节点 / 推理集群面向大模型推理、Agent 智能体、行业私有化部署需要兼容多品牌国产 NPU对 PCIe 互联、多外设扩展、供应链自主可控提出更高要求CSDN。在项目落地过程中硬件层面普遍遇到两类现实痛点通道资源瓶颈服务器 CPU 原生 PCIe5.0 通道数量有限。当一台整机需要同时挂载多块 NPU 加速卡、向量数据库 NVMe 固态盘、400G 高速网卡时原生通道不足以全部直连必须通过交换芯片做通道扩展。供应链约束部分海外 PCIe 交换器件交期波动在信创、国产化项目中存在供应链风险需要可替代的国产硬件方案。说明面向万卡级训练超节点优先使用芯片厂商私有硬件互联IX9104 主要面向推理侧中高密度整机、行业私有化算力矩阵并非替代训练超节点原生互联方案鲲鹏昇腾开...。2 IX9104 核心硬件能力与算力矩阵定位IX9104 是 104 Lane PCIe5.0 全非阻塞交换芯片单通道速率 32GT/s总带宽 1664Gbps支持 26 组可灵活配置端口典型转发延迟 116ns支持 P2P 对等直传、NTB 非透明桥接支持工业宽温固件与驱动全国产自研硬件 PIN‑TO‑PIN 对标同规格进口器件鲲鹏昇腾开...。在完整国产算力矩阵分层里硬件梯队可以简单划分硬件层级典型场景互联器件选型方向万卡级训练超节点大模型预训练、大规模集群训练原厂私有高速互联8 卡以上推理服务器集群大模型推理、Agent 并发服务IX9104 PCIe5.0 交换芯片1‑4 卡中小推理整机部门级私有化部署、行业工作站IX8024 PCIe4.0 交换芯片单卡边缘 AI 盒子边缘端推理、本地离线分析IX8008 PCIe4.0 交换芯片IX9104 的定位作为算力矩阵内部的 PCIe 层互联枢纽解决多 NPU、高速存储、高速网卡的通道扩展与数据交互问题释放整机内部硬件资源服务推理侧集群与行业私有化算力建设。关键技术能力对业务带来的收益P2P 硬件直传NPU 之间的数据交互可以绕过 CPU降低 MoE 模型、Agent 多轮调用的数据转发时延减少 CPU 资源占用。端口灵活配置端口可以自由切分 x16/x8/x4适配 NPU、NVMe SSD、高速网卡不同外设的带宽需求。NTB 多主机模式支持多主机域互联适合多节点硬件池化、存储网关类硬件设计。3 IX9104 典型应用场景分析3.1 中高密度推理服务器集群面向私有化大模型推理、DeepSeek‑V4‑Flash 这类 Agent 大模型业务。 单台服务器内部部署多块国产 NPU 加速卡同时需要挂载多组 NVMe 固态盘存放向量知识库搭配 400G 网卡对外提供推理服务。 CPU 原生 PCIe 通道数量不足以同时直连全部外设通过 IX9104 扩展 PCIe 通道实现多 NPU、高速存储、网卡的统一接入。开启 P2P 直传降低模型推理过程中卡间数据搬运的开销提升集群并发吞吐能力鲲鹏昇腾开...。适用条件以推理业务为主不需要万卡级训练规模需要整机硬件全国产适配。3.2 行业私有化智算整机政务、制造、医疗很多行业业务要求数据不出本地机房不使用公有云推理服务需要部署独立的国产算力整机。 这类场景硬件特征多 NPU 推理、大容量本地向量存储、对外接口可控对器件国产化、宽温可靠性、供应链稳定性有硬性要求。 IX9104 可以帮助整机厂商在有限 CPU 通道资源条件下完成多加速卡、存储阵列、业务网卡的硬件拓扑搭建适配信创整机项目硬件需求。3.3 AI NAS、AI 存储网关硬件AI 业务会产生大量向量数据、训练数据集AI NAS 需要同时对接多块 NPU 和大容量 NVMe 存储阵列。 IX9104 提供大量可配置 PCIe5.0 端口实现加速单元与存储单元之间高速数据交互NTB 多主机特性支持多主机访问存储资源适合 AI 存储网关硬件开发。3.4 科研仿真、数字孪生工作站科研、数字孪生场景一台工作站内部需要部署多块加速卡同时挂载多块高速固态盘处理仿真数据集。 使用 IX9104 扩展 PCIe 通道解决 CPU 通道不足问题实现多加速卡并行运算高速数据集本地读写。4 工程落地需要关注的现实约束从硬件工程实践角度采用 IX9104 做方案设计有几点需要提前评估场景边界区分万卡级训练超节点优先选用原厂私有互联IX9104 更适合推理集群、私有化整机、存储网关等场景不要直接对标训练超节点内部互联。固件与系统联合调优P2P、NTB 等高级特性需要和国产操作系统、CANN 等加速框架联合调试需要开展主板原型验证。散热与 PCB 设计PCIe5.0 信号速率高硬件设计阶段需要做好信号完整性评估做好散热设计。生态适配需要提前完成与国产 NPU、网卡、NVMe 固态盘的兼容性验证保证整套整机稳定运行。5 总结WAIC2026 释放出明确信号国产算力竞争已经从单芯片走向系统、架构、互联的综合比拼。随着国产 AI 芯片市场占比提升大量推理、行业私有化算力项目落地CPU 原生 PCIe 通道不足的硬件矛盾会持续凸显。IX9104 作为国产 PCIe5.0 交换芯片在整个算力矩阵中承担整机内部 PCIe 域的互联扩展角色。它并不替代训练超节点的私有高速互联而是在中高密度推理服务器、行业私有化整机、AI 存储网关、科研工作站等场景解决多 NPU、高速存储、网卡之间的通道扩展与高速交互问题为国产算力硬件提供一套自主可控的互联方案。算力上层模型框架持续迭代底层高速互联硬件的价值会在越来越多行业项目落地中体现出来。