
2000 台 × 8 卡 = 16000 卡级海光 X86 + 海光 DPU + RoCE + BCLL/集合通信库 + PyTorch 3 的并行计算算法总表;PyTorch 3 + Python 3.12 + NumPy + NetworkX + Matplotlib + BCLL/集合通信库 + 海光 DTK/DTK-DCU 工具链 的结合方式。📌 前置说明PyTorch 3 沿用了 PyTorch 2.x 以来的分布式路线:单卡能放下模型用DDP,放不下用FSDP2,再大用张量并行(TP)+流水线并行(PP),并可组合成多维并行;自动混合精度(AMP)在数据并行中同样适用。海光侧:海光四号 CPU 兼容 x86 指令集(C86 架构),高端 M7 型号支持 AVX-512F/BW/VNNI/BF16;海光 DCU 采用 GPGPU 架构,兼容"类 CUDA"环境,软件栈 DTK 兼容 HIP/ROCm 编程模型。BCLL(Byte Collective Library 或国产集合通信库统称)在本文中作为对标 NCCL/HCCL 的国产集合通信库使用;RoCE 场景下通过 verbs/UCX 对接海光 DPU 做通信卸载。16000 卡规