ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

显存与内存带宽全景解析:从DDR/GDDR到HBM,再到NVLink/PCIe数据搬运

显存与内存带宽全景解析:从DDR/GDDR到HBM,再到NVLink/PCIe数据搬运 声明本文作为笔者个人备忘的文章不喜勿喷。AI算力时代“内存墙”Memory Wall是比算力更关键的瓶颈。本文系统性梳理显存与内存的四大技术路线——DDR、GDDR、LPDDR、HBM 的带宽数据并对比 NVIDIA 的 NVLink 与 PCIe 互连带宽帮你建立一张完整的“数据搬运”全景图。一、带宽计算基础内存带宽的核心公式带宽(GB/s) 每引脚数据率(Gbps) × 数据总线位宽(bit) ÷ 8DDR / LPDDR64-bit单通道起算双通道翻倍GDDR按整卡显存位宽128/192/256/384/512-bitHBM单堆栈 1024-bitHBM2/3/3E或 2048-bitHBM4多堆栈并联。二、系统内存 DDR 系列代际传输速率单通道带宽双通道带宽发布年DDR3800–2133 MT/s6.4–17 GB/s12.8–34.1 GB/s2007DDR41600–3200 MT/s12.8–25.6 GB/s25.6–51.2 GB/s2014DDR54800–8400 MT/s38.4–67.2 GB/s76.8–134.4 GB/s2021要点DDR4-3200 单条理论带宽 25.6 GB/sDDR5-4800 起步 38.4 GB/s相比 DDR4 带宽提升约 2.5–3 倍。DDR5 采用“双 32-bit 子通道 片内 ECC PMIC”架构。三、移动端低功耗 LPDDR 系列代际峰值速率64-bit 带宽LPDDR44266 MT/s34.1 GB/sLPDDR56400 MT/s51.2 GB/sLPDDR5X8533–10667 MT/s68.2–85.3 GB/s要点LPDDR5X 在 AI 数据中心若采用 16 条 32-bit 通道的多控制器配置系统级理论带宽可达 384 GB/s美光实测高于 DDR5 的 358 GB/s。四、显存 GDDR 系列整卡带宽代际单引脚速率常见位宽典型整卡带宽代表GDDR58 Gbps256/384-bit256–384 GB/sGTX 1000系GDDR616–20 Gbps192/256/384-bit336–768 GB/sRTX 40主流GDDR6X19–21 Gbps384-bit672–1008 GB/sRTX 4080/4090GDDR728–36 Gbps256/384/512-bit528–1792 GB/sRTX 50系实例RTX 50系RTX 5060192-bit → 720 GB/sRTX 5070256-bit → 960 GB/sRTX 5080384-bit → 1440 GB/sRTX 5090512-bit → 1792 GB/s满血旗舰。GDDR7 采用 PAM3 三电平调制两个时钟传 3 bit取代 GDDR6 的 NRZ带宽较前代翻倍并引入片内 ECC。五、高带宽内存 HBM 系列单堆栈带宽代际发布年接口位宽I/O速率单堆栈带宽典型整卡HBM220161024-bit~2.0 Gbps~256 GB/sV100 ~900GB/sHBM2E2019–20201024-bit3.2–3.6 Gbps~410–460 GB/sA100 ~2.0TB/sHBM32021–20221024-bit6.4 Gbps~819 GB/sH100 ~3.35TB/sHBM3E2023–20241024-bit9.2–9.6 Gbps~1.2 TB/sH200 ~4.8TB/sHBM420252048-bit8–11 Gbps2.0–2.8 TB/s下一代技术本质HBM 通过 TSV 硅通孔把多颗 DRAM 垂直堆叠再用 1024/2048-bit 超宽接口实现单堆栈接近 1–3 TB/s 的带宽代价是 2.5D/3D 先进封装CoWoS成本极高。六、苹果 Mac 的统一内存方案苹果桌面 Mac 采用统一内存架构CPU、GPU、神经网络引擎共享同一块高带宽内存池基于 LPDDR5X。机型/芯片统一内存容量内存带宽Mac mini M4最高32GB约120 GB/sMac mini M4 Pro最高64GB273 GB/sMac mini M6最高32GB153–170 GB/sMac mini M5 Pro最高64GB最高307 GB/sMac Studio M4 Max最高128GB410–546 GB/sMac Studio M3 Ultra最高256GB819 GB/sMac Studio M5 Ultra最高512GB1.2 TB/s要点M5 Ultra 内存带宽 1.2 TB/s 已接近 HBM3E 单堆栈带宽超大规模统一内存512GB 高带宽使其成为本地跑百亿级大模型的性价比选择。七、NVIDIA Blackwell 架构Blackwell 采用“双 Die Chiplet 微缩放”设计维度Hopper H100Blackwell B200工艺台积电4N单Die台积电4NP双Die合封晶体管~800亿2080亿Die互联无NV-HBI ~10TB/s显存HBM3192GB HBM3E带宽3.35TB/s8TB/sHopper的2.4倍微缩放Micro-scaling第二代 Transformer 引擎支持 FP4 四比特精度将内存支撑的模型规模提升 1 倍。产品矩阵GPU芯片B100/B200/B300→ 超级芯片GB200/GB300→ 服务器HGX→ 整机DGX→ 机架超算NVL72机架总带宽 13TB/s、FP4推理达1.4 exaFLOPS。八、数据搬运速率NVLink vs PCIeNVLink 各代GPU↔GPU直连NVLink 1.0 P100 ~160GB/s2.0 V100 ~300GB/s3.0 A100 ~600GB/s4.0 H100 ~900GB/s5.0 B200/GB200 1.8–3.6TB/s6.0 Rubin 再翻倍。PCIe 各代x16PCIe 3.0 x16单向16GB/s/双向32GB/s4.0 32/645.0 64/1286.0 128/256 GB/s。对比结论PCIe 5.0 x16 双向128 GB/s vs NVLink 5.0 3.6TB/s差距约14–28倍NVLink 延迟几ns远低于PCIe且数据访问无需CPU中转GPU直接互访。九、数据搬运全景三层金字塔层级技术带宽量级代表数值片上存储HBM3E/HBM4TB/s级1.2–2.8 TB/s片上存储GDDR7整卡1–1.8 TB/sRTX5090 1.79TB/s统一内存苹果Mac0.1–1.2 TB/sM5 Ultra 1.2TB/s计算单元互连NVLink5TB/s级1.8–3.6TB/s系统总线PCIe 5.0/6.0128–256GB/s0.13–0.26TB/s节点间网络InfiniBand12.5–100GB/sNDR 50GB/s核心结论数据搬运呈金字塔三层显存/内存TB/s GPU互连 NVLinkTB/s 系统/网络GB/s跨设备搬运永远是最大瓶颈。H200 显存带宽4.8TB/s 远大于 NVLink 900GB/s说明片内读取远比片间搬运快算法要最大化数据复用。大模型训练时调度器优先把高频通信的 GPU 放在同一 NVLink 域。十、总结类别带宽范围定位DDR3–DDR56–134 GB/s主流系统内存LPDDR5/5X34–85 GB/s移动/嵌入式GDDR5–GDDR7256–1792 GB/s游戏/图形/边缘AIHBM2–HBM4256GB/s–2.8TB/sAI训练/推理/超算NVLink160GB/s–3.6TB/sGPU集群互连PCIe4–512 GB/s系统通用总线从 DDR 到 HBM从 PCIe 到 NVLink每一次带宽跃迁都源于对“内存墙”与“数据搬运瓶颈”的突破。在 AI 算力时代谁能把数据更快地送到计算单元谁就掌握AI性能的制胜关键。
返回列表