
文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载本文是 AISystem 仓库《国外 AI 芯片》系列课程的 TPU 正代芯片终章承接 04TPUIntrol.md 的 TPU 历史演进与 07TPU3.md 的 TPU v3 Pod 形态。全文以 TPU v4 芯片架构、Sparse Core 稀疏计算核、3D Torus 光互联与 Palomar 光路交换机为主线完整覆盖芯片微架构、产品规格、集群拓扑与光交换原理并补充与英伟达 DGX SuperPod 的集群对比与优缺点权衡。读完本文你将掌握 TPU v4 从单芯片到 4096 节点超级计算机的完整技术栈理解稀疏计算硬件加速、光路交换与 3D Torus 拓扑在大规模 AI 训练集群中的设计逻辑。为什么 TPU v4 值得单独一章TPU v32018 年到 TPU v4 之间相隔了四年。这四年里谷歌并没有停下脚步——它把更多精力放在了面向大众的芯片上例如 Pixel 手机系列里的 Pixel Visual Core、Pixel Neural Core 与谷歌 Tensor但 TPU 正代芯片一直没有更新。而这四年间业界环境发生了三个关键变化英伟达迭代了三代架构从 VoltaV100到 AmpereA100再到 HopperH100GPU 在 AI 训练市场的统治力持续增强训练框架易主PyTorch 取代 TensorFlow 成为业界的首选训练框架超大算力需求爆发大模型的出现对单卡算力之外的大规模并行计算能力提出了前所未有的要求。TPU v4 正是谷歌针对上述问题给出的答卷。它围绕一个核心命题展开设计大模型的训练瓶颈已经从单芯片算力转移到集群互联与规模化能力。这也是 TPU v4 首次在 Pod 层面引入光交换OCS与 3D Torus 拓扑的根本原因。TPU v4 芯片架构总览每个 TPU v4 包含两个 Tensor Core每个 Tensor Core 内部由六个单元组成四个 MXUTPU 最核心的脉动阵列Systolic Array矩阵乘法单元延续了自 TPU v1 以来的脉动阵列设计详见 05TPU1.md一个 Scalar Unit负责标量计算一个 Vector Unit负责向量计算。此外芯片上还有两个 HBM 内存模块分别放置在两个 Tensor Core 的左右两侧。这种布局并非随意为之——将 HBM 紧贴计算核心两侧是为了尽量缩短数据在片内传输的物理路径从而降低电缆与走线的时延这在超大算力集群中直接影响整体性能。产品形态对比TPU v4 相比前代在产品形态上变化巨大主要体现在四个方面制造工艺从 TPU v3 的 16 nm 提升到 7 nm 工艺是谷歌在 TPU 制程工艺上最大的一次更新硬件规模MXU 数量相比 TPU v3 再翻一倍片上缓存增加 9 倍达到244 MB不同资料来源存在 244 MB 与 288 MB 两种表述本文以本节文档为准HBM 容量保持32 GB不变但内存带宽提升到1.2 TB/s相比前代提升了 33%Sparse Core硬件层面新增稀疏计算核专门利好稀疏计算场景并基于 TPU v4 改良了自有 Transformer 模型架构3D Torus 互联首次亮相 3D Torus 互联方式紧密耦合 4096 个 TPU v4 引擎使 TPU v4 Pod 总计提供1.126 Exaflops 的 BF16 峰值算力。其中 Sparse Core 与 3D Torus 是 TPU v4 区别于前代的两大核心技术下面分别展开。Sparse Core为稀疏计算而生的专用硬件Embedding 层的计算本质先看一个计算范式问题。Embedding 处理的是离散型分类特征Categorical Features这是稀疏化的典型计算范式。NLP、搜索推荐算法只支持字符串形式输入这些输入被标示为离散的稀疏向量特征。这些特征本质上更像一张哈希表而不是适合映射到硬件矩阵乘法单元进行张量计算的稠密数据。原因在于输入矩阵中存在极大量的 0这些 0 本身不需要参与计算或者可以大幅简化计算若按照传统矩阵乘法逐项相乘会反复执行大量0 × 权重的无意义乘法白白浪费计算资源将稀疏变量放到 Tensor Core 上计算往往涉及小规模的内存访问动作很容易触及 CPU 与 DRAM 的性能瓶颈——尤其是在 TPU 与 CPU 比例为 4:1 的 TPU 集群中网络中心的延迟还会进一步放大这种负面影响。因此TPU 需要一种能够高效处理稀疏变量的计算范式。深度学习神经网络通常在稠密 Tensor 上计算性能更优所以需要先对稀疏矩阵进行信息压缩通过特定的 Embedding 层生成稠密的原始数据表达——这通常就是 NLP 或搜推算法的第一层。上图是搜索推荐场景最经典的模型框架Deep Wide Model。Wide Deep 本身是一个框架Wide 部分可以是任意广义线性模型而 Deep 部分则是 Embedding 加全连接神经网络。图中 Deep Models 部分清晰展示了用户稀疏特征先被处理成稠密 Embeddings再进入中间的隐藏层协同 Wide Models 输出最终单元。TPU v4 的 Sparse Core 在硬件中原生支持 Embedding 计算的模型并行与数据并行提供了极大的并行灵活度让大规模 Embedding 计算能够在超大规模集群内被妥善处理。当 NLP 或推荐的语料规模非常庞大时就需要在 Embedding 层进行切分、并行TPU v4 直接把这些特性固化到了硬件里。Sparse Core 核心架构Sparse CoreSC中最通用的单元是16 个 tiles计算瓦片每个瓦片都关联一个 HBM 通道并支持多个内存访问。每个瓦片内部包含三个关键部件部件职责Fetch Unit从 HBM 读取激活函数和参数加载到瓦片内的2.5 MiB 稀疏向量内存Spmem切片中scVPU可编程的 8 路 SIMD 向量处理单元注意与 Tensor Core 中的 Vector Unit / VPU 区分是稀疏数据快速计算的核心Flush Unit在反向传播过程中将更新后的参数写回 HBM除了 16 个瓦片图中的深蓝色方框还有五个跨通道单元图中的金色方框在 16 个 Spmem 上执行与其名称相对应的嵌入操作例如稀疏归约、排序、数据搬运等具体见 srt/08.srt 中对应讲解。与 TPU v1 一样这些单元执行类似CISC 的指令处理可变长度的输入——每条指令的运行时间取决于实际数据。这正是稀疏计算与传统稠密矩阵计算在指令模型上的根本差异数据长度不固定指令执行时间随数据动态变化。TPU v4 Pod1.126 Exaflops 的超级计算机TPU v4 Pod 能提供 Exaflops 级别的算力核心原因在于其强大的芯片间互联能力。谷歌的构建方式分两步将 4 × 4 × 4 64 个 TPU v4 芯片互联在一起形成一个立方体结构Cube再把多个 4 × 4 × 4 Cube 用光互联连在一起形成一个总共包含4096 个 TPU v4 芯片的超级计算机。光互联OCS在如此规模的超级计算机中芯片间互联在很大程度上决定整体计算效率。如果数据互联效率不够高很多时候芯片都在等待来自其他芯片的数据到达才开始计算——计算单元空转整体利用率上不去。因此必须确保芯片之间高带宽、低延迟的互联而光互连对于物理距离较远的芯片就成为首选。谷歌在 TPU v4 Pod 中应用了光交换器OCSOptical Circuit Switching来避免计算与通信的相互等待644 × 4 × 4颗 TPU 构成一组负责 Slice 间的互连实现 Pod 内 Slice 间全光互连4096 TPUsOCS 同样可用于 Pod 之间的互连而不仅局限于芯片之间。一个值得关注的数据点在使用可配置光互连以及光路开关时假设芯片可靠率为 99%其整体系统的平均性能提升比不使用 OCS 可高达 6 倍。光互连开关的重要性由此可见一斑。3D Torus 拓扑结构TPU v4 Pod 采用3D Torus拓扑结构实现芯片间互联。在 3D Torus 网络中每个节点通过三个维度的连接与相邻节点相连形成一个三维网格结构节点在X-Y-Z 三个维度上形成一个连续循环环面因此最边上的节点会连接到相对面上的节点每个节点与上下、左右、前后共6 个节点互联形成高度互联的闭合结构这种结构提供高带宽和低延迟的通信能力非常适合高性能计算和大规模并行处理。TPU v4 通过该拓扑紧密耦合 4096 个 TPU v4 引擎实现总计 1.126 Exaflops 的 BF16 计算能力。每个 TPU v4 端口对应一个 TPU v4 芯片端口连接交换机提供6 Tb/sec 的带宽作为网络接口卡和 3D Torus 网络的基础。Cube 与 OCS 的链路计算进一步拆解这个 Cube为了实现 6 面连接每个面需要16 条链路因此每个 Cube 总共有96 条光链路连接到 OCS 上。为了让整个 3D Torus 连接起来相对的两个侧面需要连接到同一个 OCS上这正是图中不同色块与 Cube 之间长环的含义。于是$$每个 Cube 连接的 OCS 数量 6 \times 16 \div 2 48$$这 48 个 OCS 一共连接来自 64 个 Cube 的 48 对光缆总计并联4096 个 TPU v4 芯片。由此可以推算搭建一个 TPU v4 集群的基本清单4096 片 TPU v4 芯片 48 个 OCS 光互联交换器成本相当之高。值得注意的是在每一家公司和投资人都愿意无上限为模型花钱的时代传统大厂在成本投入上的优势相对于新兴 AI 公司例如 OpenAI 与 Anthropic正在缩小芯片产能与电力资源这类物理限制反而成了各家迭代模型的最大瓶颈。与英伟达 DGX SuperPod 的集群对比当时的竞品状态如何英伟达 DGX SuperPod 搭配第四代 NVLink/NVSwitch最多连接32 个 node、总计 256 颗 H100 芯片每颗 GPU 实现900 G/s 的互连带宽NV 每机架 4 台 DGX共 32 颗 H100 GPU机架内/外需要光纤连接NV 的每机架算力密度相对更小/更窄需要更多的收发激光器和光纤线材网络成本高若要部署 4096 颗 GPU 集群必须切分成更多个 SuperPod 并独立规划互连网络层中间完成多层交换集群内总计需要采购大约568 个 InfiniBand Switch。反观 TPU v4 Pod与超级计算机一样工作负载由不同规模的算力承担称为切片Slice例如 64 芯片、128 芯片、256 芯片等。与 InfiniBand 相比OCS 的成本更低、功耗更低、速度更快成本不到系统成本的 5%功率不到系统功率的 3%每个 TPU v4 都包含 SparseCores 数据流处理器可将依赖嵌入的模型加速 5 至 7 倍但仅使用 5% 的裸片面积和功耗。Palomar基于 MEMS 的光路交换机光路开关芯片上文提到的光路开关芯片名为Palomar采用基于MEMS 反射镜阵列的技术。其基本原理是使用一个 2D MEMS 反射镜阵列通过控制反射镜的位置来调整光路从而实现光路切换。相比传统光电转换交换MEMS 光路开关芯片具备低损耗、低切换延迟毫秒级别、低功耗、低成本四大优势。2D MEMS 阵列每个陶瓷封装内部是一个大型芯粒芯粒内有176 个可单独控制的微反射镜。从反射镜阵列的热成像图可以清楚看到每个微反射镜四周都有四个梳状驱动区域用于在两个方向上旋转反射镜使光可以进行光路切换。Palomar 工作原理Palomar OCS 的工作原理可以从信号路径来理解绿色线条表示带内光信号路径与带内信号路径叠加的是一个850 纳米波长的监控通道红色箭头用于校准镜面输入/输出的光学信号通过二维2D光纤准直器阵列Fiber collimator array进入光学核心每个准直器阵列由一个 NxN 光纤阵列和 2D 透镜阵列组成核心是其中的两组 2D MEMS 阵列MEMS 的镜面在监控通道的校准下被驱动、倾斜将信号切换到相应的输入/输出准直光纤。为什么要用 OCS 而不是传统交换机传统交换机传进来的是光缆需要先把光转化成电、再把电转成光输出这个光-电-光转换过程会造成大量性能损耗。而 OCS 提供的是光到光的直接转换从而节省了非常多的电能更重要的是解决了大量时延问题——这正是大规模 AI 集群中互联延迟敏感场景所迫切需要的。TPU v4 优缺点分析TPU v4 Pod 在成本、功耗和速度方面展示了明显优势。但是尽管 3D Torus 拓扑带来了低延迟和低网络成本的益处也存在一些挑战包括系统成熟度、拓扑僵硬性以及负载均衡问题。下面从正反两面完整梳理。优点低时延3D Torus 的相邻节点之间是短而直接的连线因此延迟更低尤其当节点间需要运行密集 I/O、紧耦合的并行任务时特别有用低网络代价对于相同数量的节点3D Torus 拓扑的网络直径低于 Clos 拓扑前者的交换机/线材/连接器保有量更低网络层次更少节省硬件成本路由可重配谷歌 OCS 网络支持动态可重配路由Slice 集群在部署之后可以立即投入生产无需等待整个网络收敛并且这种特性更容易隔离/下线故障节点更好的集群布局集群布局让物理上相邻的节点在逻辑上也临近让密集 I/O 通信、data-flow 发生在局部流域换来更低的通信开销同时优化延迟和功耗。这就是 3D Torus 将大集群逻辑切割成紧耦合的局部域局部互连并共享作业的设计思想。缺点系统成熟度低Clos 拓扑本身具备非阻塞特点性能始终保持一致且可以预测所有输入/输出都是全带宽同时连接无冲突无阻塞——这在 3D Torus 拓扑中无法保证拓扑僵硬在 Clos 这种 Spine-Leaf 脊叶拓扑中扩容新的叶交换机相对简单无需更改当前架构相比之下扩缩 3D Torus 结构比较复杂和耗时可能需要重新配置整个拓扑负载均衡问题Clos 网络在任意两个节点之间提供更多路径从而实现负载均衡和冗余虽然 3D Torus 结构也提供多路径冗余但 Clos 的替代路径数量更多具体取决于网络的配置。小结与思考回顾整章内容可以提炼出三条主线模型的演进总是快于芯片的设计迭代。随着大模型的涌现训练越来越依赖 AI 计算集群的规模化能力而非单芯片算力TPU v4 的设计重心正是对高效互联和规模化的支持算法-芯片协同设计是 TPU v4 的灵魂。AI 芯片与算法之间的结合继续保持紧密关系具体体现在对新数据格式HF32/BF16的支持、对稀疏计算的原生支持、以及对模型关键算法专用加速器的引入如 Sparse CoreBenchmark 之外的很多生产环境性能指标无法直观评测。XLA 编译器的优化效益也难以直观评测TPU v4 是否如网上披露的信息那般强悍仍有待实际生产环境的验证。作为历史上最有远见的科技公司之一谷歌能否在大模型时代继续保持曾经的远见才是决定它能否在这个时代乃至下一个时代引领世界的关键。本文内容基于 08TPU4.md 整理扩展配套 PPT 与视频资源位于 02Hardware/05Abroad 目录含 08TPU4.pdf 与字幕 srt/08.srt。建议按顺序阅读 04TPUIntrol.md → 05TPU1.md → 06TPU2.md → 07TPU3.md → 本文以形成 TPU 全系列的知识闭环。赞分享文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载相关推荐谷歌 TPU 历史发展全解析AISystem 视角下的 AI 芯片架构演进与脉动阵列设计谷歌 TPU 历史发展全解析AISystem 视角下的 AI 芯片架构演进与脉动阵列设计 本文是 AISystemAI 系统全栈底层技术课程中《国外 AI文档教程人工智能x64dbg 短 INT3 断点删除竞态回归测试解析swbp_stale 测试的构造、时序与验证x64dbg 短 INT3 断点删除竞态回归测试解析swbp_stale 测试的构造、时序与验证 导读 swbp_stale 是 x64dbg 测试套件中的一文档教程人工智能文言wenyan-lang演进全史从 v0.1.2 到 v0.3.2 的编译 API、宏、类型推断与标准库路线图文言wenyan lang演进全史从 v0.1.2 到 v0.3.2 的编译 API、宏、类型推断与标准库路线图 导读 本篇基于仓库根目录的 CHANGE文档教程人工智能上一篇FanControl终极指南3步实现Windows风扇智能控制告别噪音烦恼下一篇天龙八部单机版GM工具5分钟快速上手指南与完整功能解析创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考