SSD 在 AI 训练中的角色 SSD 在 AI 训练中的角色 AI 训练的存储挑战现代大模型训练对存储提出了前所未有的要求GPT-4 级别模型训练 ├── 训练数据集 数十 PB 级 ├── 模型参数 数千亿参数数百 GB ~ TB 级 ├── Checkpoint 每隔数小时保存一次TB 级写入 ├── 数据加载速度 必须跟上 GPU 计算速度 └── GPU 利用率目标 90%存储不能成为瓶颈核心矛盾GPU 算力飞速增长存储 I/O 若跟不上GPU 就会饿着等数据。️ AI 训练集群的存储架构┌─────────────────────────────────────────────────┐ │ GPU 训练节点 │ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │ │ GPU │ │ GPU │ │ GPU │ │ GPU │ │ │ └──────┘ └──────┘ └──────┘ └──────┘ │ │ ↑ 数据加载关键路径 │ └──────────────┼──────────────────────────────────┘ │ ┌──────────▼──────────────────┐ │ 存储层三级架构 │ │ │ │ L1本地 NVMe SSD最快 │ │ 热数据缓存 / Checkpoint │ │ │ │ L2NVMe-oF 共享存储池 │ │ 训练数据集 / 模型权重 │ │ │ │ L3对象存储 / HDD 归档 │ │ 冷数据 / 历史 Checkpoint │ └──────────────────────────────┘ 存储性能如何影响 GPU 利用率场景ResNet-50 训练batch size 256 存储类型 数据加载时间 GPU 等待时间 GPU 利用率 ───────────────────────────────────────────────────── HDD7200RPM 800 ms/batch 600 ms ~42% ❌ SATA SSD 120 ms/batch 20 ms ~83% ⚠️ NVMe SSDD5 18 ms/batch 0 ms ~99% ✅ NVMe-oF 存储池 22 ms/batch 0 ms ~98% ✅从 HDD 换成 NVMe SSDGPU 利用率从 42% 提升至 99%——相当于同等算力投入多获得 2.4 倍的训练效率 AI 训练的三大存储场景场景一训练数据加载Data Ingestion需求 ├── 超高顺序读带宽GB/s 级 ├── 大量小文件随机读图片、文本 token ├── 多 GPU 并发读取需要高 IOPS └── 容量优先数据集动辄数十 PB 最优选择Solidigm D5-P5336QLC高容量低成本 ├── 单盘 122TB大幅减少盘数 └── 顺序读带宽7,200 MB/s场景二Checkpoint 保存/恢复需求 ├── 突发大量写入TB 级数分钟内完成 ├── 写入延迟敏感停止训练等待写完 ├── 高耐久性频繁大块写入 └── 快速恢复故障后秒级重启训练 最优选择Solidigm D7 系列TLC高耐久 ├── 高 DWPD应对频繁 Checkpoint └── 低延迟写入减少 GPU 停机时间场景三模型权重加载Inference 推理需求 ├── 极低延迟首个 token 生成时间 ├── 高并发随机读多用户同时请求 ├── 模型文件通常数十至数百 GB └── 读多写少 最优选择D5大容量 D7低延迟混合部署 SSD vs GPU 内存存储层级新思考传统 AI 推理瓶颈 模型太大如 LLaMA-3 70B ≈ 140GB GPU HBM 内存不够用 ↓ 新思路SSD 作为扩展内存 GPU HBM80GB带宽 3.35TB/s ↕ PCIe 带宽~64GB/s 本地 NVMe SSD数TB带宽 ~7GB/s ↕ NVMe-oF 存储池 → 冷参数放 SSD热参数放 HBM → 实现超大模型在有限 GPU 内存下推理 → 成本SSD 远低于 HBM$/GB 差距 100 倍以上 AI 时代的存储趋势2020 GPU 算力增长 ──────────────────────────→ 持续爆炸式增长 存储 I/O 增长 ──────→ 开始跟不上 2023 存储瓶颈凸显 ├── PCIe Gen5 SSD 普及~14GB/s ├── NVMe-oF 存储池化成主流 └── CXL 内存扩展崭露头角 2025 下一步 ├── PCIe Gen6~28GB/s ├── CXL 3.0 共享内存池 └── 计算存储Computational Storage → SSD 内置 AI 推理加速 一句话总结在 AI 时代SSD 不再只是存数据的地方——它是 GPU 算力的粮仓Checkpoint 的保险箱超大模型的扩展内存。存储 I/O 的速度与容量直接决定了 AI 基础设施的投资回报率。

本月热点