从 vega 64 到 MI 100 ,AMD GPU 的裂变历史 有传言当年 vega 是 64 核 mi 系列最大的改动是从 64 改成 128 核架构。改的昏天昏地mi 100 还出了 2 和大bug。其中这里的**“核”**指的是 AMD GPU 架构中的Compute UnitCU计算单元。它是 AMD GPU 的基本调度与执行块相当于 NVIDIA 的 SMStreaming Multiprocessor。但 CU 内部还有更细的层次需要一并厘清才能理解64核到128核到底改动了什么。一、核在 AMD GPU 中的层级AMD GPU 的执行层级从大到小大致是层级名称说明顶层Compute Unit (CU)用户口中的核。Vega 64 就是 64 个 CU。CU 内部4 × SIMD 单元每个 SIMD 是 16-lane 的向量 ALUVALU。SIMD 内部Wavefront / Lane一个 Wavefront波前 64 个线程每个 SIMD 每周期处理 16 个 lane一条 wave64 指令需要 4 个周期才能在一个 SIMD 上执行完。因此Vega 64 的64核 64 个 CU每个 CU 内含 4 个 SIMD-16共计4096 个 Stream Processor64 CU × 64 SP。二、从 Vega 64 到 MI 系列架构分叉与128核2020 年前后AMD 将 GPU 架构彻底一分为二RDNARadeon DNA面向游戏/图形继承自 GCN/Vega后续发展为 RX 6000/7000 系列。CDNACompute DNA面向 HPC/AI/数据中心即 Instinct MI 系列。这次分叉被形容为改的昏天暗地因为 AMD 把原本兼顾图形与计算的 GCN/Vega 架构彻底拆开图形管线被大量裁剪CU 内部结构也向纯计算大幅倾斜。MI100CDNA 1120 CUMI100 是第一款 CDNA 产品120 个 CU7680 个 Stream Processor。它已不再是带计算能力的显卡而是纯计算加速器——砍掉了大量图形专用单元ROP、TMU 等比例大幅缩减引入了 Matrix Core矩阵核心和针对 FP64/BF16 的优化。CDNA 2MI200 系列128 CU per Die你提到的128核更准确地对应CDNA 2MI200 系列的Aldebaran 核心。它采用MCM多芯片封装每颗 Die 集成128 个 CU两颗 Die 通过 Infinity Fabric 互联总共256 CU。所以从 64 改成 128 核架构的脉络是产品架构CU 数量定位Vega 64GCN 5th Gen64 CU游戏/通用计算混合MI100CDNA 1120 CU纯计算第一代MI250XCDNA 2128 CU × 2 Die 256 CU纯计算MCM 多芯片从 Vega 到 MI 系列CU 数量翻倍不止但更重要的是CU 内部结构也发生了根本变化WavefrontGCN/Vega 固定 wave6464 线程宽CDNA 保持 wave64但针对矩阵运算增加了 MFMA 指令。寄存器与矩阵单元CDNA 引入了 AGPRAccumulation GPR和专用 Matrix Core这是 Vega 完全没有的。显存从 Vega 的 HBM2484 GB/s跃升到 MI100 的 HBM21.2 TB/s再到 MI200 的 HBM2e。三、MI100 “还出了两个大 bug”MI100 作为 AMD 首款纯计算加速器 ROCm 生态早期产品确实暴露了不少硬件与固件层面的缺陷社区和数据中心用户反馈主要集中在以下两类1. 电源管理缺陷固件/驱动级MI100以及 MI210不支持有效的运行时电源管理。amdgpu.runpm功能在尝试将卡挂起到 D3cold 状态后恢复时会直接挂死报错SMC engine is not correctly up!。结果是空闲时显存也无法降速持续耗电约 50W成为电暖气。AMD 将此标记为已知缺陷长期未修复。2. 初始化/兼容性 bug硬件级MI100 在部分消费级/服务器主板上存在初始化失败问题表现为amdgpu: probe failed with error -12在 AM4 平台如 B550 Ryzen 3900X上即使开启 Above 4G Decoding、关闭 CSM 也无法正常初始化。部分用户反馈 lspci 都识别不到设备需要反复刷 BIOS 或更换平台才能解决。此外早期 ROCm 对 MI100 的支持也相当粗糙PyTorch/TensorFlow 适配延迟长hipGraph 等 API 在 MI100 上存在确定性 bug如hipGraphAddMemcpyNode1D依赖不生效。总结“核” Compute Unit (CU)AMD GPU 的基本计算块。Vega 64 64 CUGCN 架构最后的游戏旗舰。MI 系列转向CDNA 纯计算架构MI100 120 CU、MI200 128 CU/DieMCM 双 DieCU 数量与内部结构都发生了质变。MI100 的大 bug主要指电源管理失效和平台初始化兼容性差加上早期 ROCm 软件生态不成熟导致这款首发 CDNA产品在数据中心部署时踩坑颇多。