ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

英伟达九大 GPU 芯片全对比:GB10、GB200、GB300、H200、H20、H100、A100、A800、V100

英伟达九大 GPU 芯片全对比:GB10、GB200、GB300、H200、H20、H100、A100、A800、V100 英伟达九大 GPU 芯片全对比GB10、GB200、GB300、H200、H20、H100、A100、A800、V100声明本文作为笔者个人备忘的文章不喜勿喷。 · 综合 NVIDIA 官方规格、IT之家/CSDN/腾讯云/什么值得买等社区与产业媒体、小红书/公众号观点2026-09一、三大架构世代速览Volta2017V100 —— Tensor Core 诞生AI 加速元年。Ampere2020A100 / A800 —— MIG 隔离、TF32、第三代 Tensor Core训练主流。Hopper2022H100 / H200 / H20 / H800 —— 第四代 Tensor Core、Transformer Engine、FP8推理性能跃升。Blackwell2024B200(GB200) / B300(GB300) / GB10 —— 第五代 Tensor Core、FP4、第二代 Transformer Engine把 AI 算力推向 EFLOPS 级。注GB200 / GB300 是「Grace CPU Blackwell GPU」超级芯片GB10 是桌面级超级芯片DGX Spark。二、核心参数总对比表型号架构SM 数CUDA 核心Tensor Core显存显存带宽算力(FP4/FP8/FP16 约)NVLink功耗定位V100Volta805120640(二代)16/32GB HBM2~900 GB/sFP16 混合 ~125 TFLOPSNVLink2 300 GB/s300W早期AI/超算A100Ampere1086912432(三代)40/80GB HBM2e1.6 / ~2.04 TB/sBF16 稠密 ~312 TFLOPSNVLink3 600 GB/s400W训练主流A800Ampere108691243280GB HBM2e~2.04 TB/sBF16 稠密 ~312 TFLOPSNVLink 400(砍)400WA100中国合规版H100(SXM)Hopper13216896528(四代)80GB HBM33.35 TB/sFP8 稠密 ~1979 / FP16 ~990NVLink4 900 GB/s700W训练高性推理H200Hopper13216896528141GB HBM3e4.8 TB/sFP8 稠密 ~1979NVLink4 900 GB/s700WH100大显存升级H20Hopper约78约9984—96GB HBM3/141G版4.0 / 4.8 TB/sFP8 296 / FP16 148NVLink 900(满血)400W中国特供·带宽型GB10(DGX Spark)Blackwell486144五代128GB LPDDR5X273 GB/sFP4 稀疏 ~1 PFLOPNVLink-C2C240W桌面AI超算GB200(B200)Blackwell——五代192GB HBM3e最高 ~8 TB/sFP4 约 9 PFLOPSNVLink5 1.8 TB/s~1000W旗舰训练/超大模型GB300(B300)Blackwell——五代279/288GB HBM3e~8 TB/sFP4 约 15 PFLOPSNVLink5 1.8 TB/s—旗舰·Ultra说明SM/CUDA 数B200/B300、H20 部分官方未公开表中为行业口径同一型号不同子版本SXM/PCIe、40G/80G、96G/141G参数有差异以官方数据表为准。三、逐款解析1. GB10DGX Spark · 桌面级 Blackwell 超级芯片Blackwell 架构48 SM、6144 CUDA、第五代 Tensor Core原生 FP4。128GB LPDDR5X 统一内存CPU/GPU 共享带宽仅273 GB/s—— 容量大、带宽是短板。20 核 ARM CPU 通过 NVLink-C2C 与 GPU 合封FP4 稀疏算力约 1 PFLOP。定位全球最小桌面级 AI 超算本地跑 ~200B 推理 / 70B 微调。2. GB200Grace Blackwell · B200 GPUB200 双芯粒设计2080 亿晶体管192GB HBM3e带宽最高8 TB/sFP4 约 9 PFLOPS。第五代 NVLink1.8 TB/s双向PCIe Gen6TDP 约 1000W。GB200 超级芯片 1 颗 Grace CPU 2 颗 B200 GPUNVL72 机架级互联适合超大模型训练/高吞吐推理。3. GB300Blackwell Ultra · B300 GPU显存升级至279/288GB HBM3e8192-bit带宽约 8 TB/sFP4 算力约15 PFLOPS较 GB200 增 ~66%。网络升级 800 Gb/sCX-8GB300 NVL72 峰值1.1 EFLOPS FP4MLPerf Training 6.0 全项霸榜。大内存 大功耗预算深度 MoE 训练受内存约束下优势显著。4. H100Hopper132 SM / 16896 CUDA/ 528 第四代 Tensor Core。80GB HBM3、3.35 TB/sFP8 稠密约 1979 / BF16 稠密约 990 TFLOPS。第四代 NVLink 900 GB/sTDP 700WTransformer Engine、MIG、机密计算。上代数据中心训练/推理主力。5. H200Hopper 大显存与 H100 同架构同 SM132但显存升级为141GB HBM3e、带宽4.8 TB/s。相同 CUDA/FP8 算力换大显存高带宽解决 LLM 显存墙与带宽瓶颈是推理场景高性价比升级。6. H20中国特供 · Hopper与 H100 同一颗 GH100 die但算力大砍FP16 仅148 TFLOPS约 H100 15%、FP8 296 TFLOPS。反其道保显存/带宽/互联96GB HBM3新版 141G、4.0/4.8 TB/s、NVLink 900 GB/s 满血。定位契合推理时代——瓶颈在带宽而非算力成为国内合规采购主力。7. A100Ampere108 SM / 6912 CUDA/ 432 第三代 Tensor Core。40/80GB HBM2e带宽 1.6 / ~2.04 TB/sBF16 稠密约 312 TFLOPS。第三代 NVLink 600 GB/sTDP 400WMIG多实例隔离可训练可推理国产算力老将。8. A800A100 中国合规版与 A100 算力/显存相同80GB HBM2e仅NVLink 从 600 GB/s 降至 400 GB/s限制多卡集群规模。目的满足出口管制仍是国内早期大模型集群主力之一。9. V100Volta80 SM / 5120 CUDA/ 640 第二代 Tensor Core16/32GB HBM2带宽约 900 GB/s。功耗 300W最早将 Tensor Core 引入 AI 计算的功勋卡现基本被 A100/H100 取代。四、关键差异解读1. 算力 vs 带宽谁跑得快看模型阶段训练/预填充算力受限 → GB200/GB300、H100 更强推理/解码带宽受限 → H200(4.8TB/s)、H20(4TB/s) 反而占优GB10 的 273GB/s 是短板。2. 中国特供三件套A800 / H800 / H20管制思路演变A800/H800 保算力砍互联防万卡集群H20 砍算力保互联显存防单卡强算力。结果H20 在推理为主的时代反而比算力满血的 H800 更适合——带宽决定推理体验。3. 高级功能演进功能V100A100H100/H200H20GB10/GB200/GB300Tensor Core二代三代四代四代五代MIG 多实例无有有有有Transformer Engine无无一代一代二代FP8无无有有(削减)有FP4无无无无有机密计算/TEE无无有有有(TEE-I/O)统一内存/CPU协同无无无无NVLink-C2C五、选型建议个人观点供参考旗舰训练GB300(B300) GB200(B200) H200 H100 —— 大模型训练吃算力显存。大模型推理/高并发H200(4.8TB/s) H20(4TB/s) H100 —— 带宽优先。国内合规采购H20推理/ A800训练存量为主受限场景优先带宽型。桌面/本地实验GB10 (DGX Spark) —— 容量够、带宽有限跑 MoE 量化效果好。预算有限/存量A100 80GB 仍是训练推理均衡的性价比之选V100 基本过时。六、结语从 V100 到 GB300英伟达的演进在算力、显存、带宽、互联、低精度、安全六个维度同步加码而中国特供 H20/A800 的砍法差异反而折射出推理时代带宽算力的真实需求。选型没有绝对好坏算力装模型、带宽定体验、互联撑规模——看清瓶颈在哪才是选对卡的关键。声明本文作为笔者个人备忘的文章不喜勿喷。主要参考来源公开资料NVIDIA 官方规格/技术博客Blackwell MLPerf 6.0、IT之家GB300 288GB/1.1EFLOPS、GitHub AI-fundamentalsGB200 vs GB300 参数、腾讯云/华为云A100 vs H200、H100 vs B200 对比、CSDNH20 深度解读、什么值得买九卡对比、掘金GPU 选型坑、始智AI wisemodelH20-141G 算力、太平洋科技昆仑芯对标 H20等。本文基于 2026-09 公开信息与社区资料整理涉及型号参数SM/CUDA 数、算力等官方未公开部分以行业口径为准最终以 NVIDIA 官方数据表为准。本文由 AI 辅助整理。
返回列表