ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

英伟达130亿美元收购Mellanox:从GPU到数据中心网络平台的野心

英伟达130亿美元收购Mellanox:从GPU到数据中心网络平台的野心 当一家公司已经站上AI时代牌桌的正中央它到底还在怕什么这是我看到“英伟达砸130亿美元买下一个平台”这条消息时的第一反应。2019年英伟达宣布以69亿美元收购Mellanox后面又叠加团队整合、生态投入、研发协同等一连串成本行业里有人把这笔收购的总代价算到了130亿美元上下。Mellanox不是做显卡的也不做CPU它是一家做数据中心网络互连的公司核心产品是InfiniBand、高速以太网、交换机和DPU智能网卡。用最简单的话说英伟达买的不是一个配件厂而是数据中心内部那条“数据高速公路”。这篇分析不聊股价涨跌也不讲高管八卦只想从技术和商业逻辑出发把几件事讲透这笔钱到底花在哪了、黄仁勋买回来的东西为什么被称作“平台”、以及这笔收购如何改变了整个计算行业的攻防态势。如果你做AI训练、搞高性能计算或者只是好奇芯片巨头之间的合纵连横这篇文章都值得看完。1. 账面上的69亿和谈资里的130亿Mellanox收购案全景复盘1.1 官方数字与市场谈判69亿为什么被说成130亿先说一个容易让读者犯迷糊的点英伟达官方公布的Mellanox收购对价是69亿美元现金为什么外界会把它和“130亿美元”挂钩这其实不能怪媒体夸张。2019年3月英伟达宣布收购Mellanox最终成交价是每股125美元总对价约69亿美元。当时这已经是英伟达历史上最大的一笔收购。但收购账不能只看成交那一刻的现金后续还有三笔隐形成本第一人才和研发部门的整合成本。Mellanox总部在以色列英伟达收购后不但要保留团队还要持续加码研发投入DPU、DOCA软件栈、网络交换机这些产品线都在不断烧钱。第二生态扶持成本。英伟达收购后把网络业务纳入数据中心集团每年GTC大会都在推网络新品这些产品从流片到量产、从开发者布道到客户支持都是真金白银。第三战略机会成本。69亿美元放在那里如果不买Mellanox而是去买别家公司或者干脆回购股票账面上可能更漂亮。把这几年来的实际投入和后续扩展加在一起说“总成本接近130亿美元”并不算离谱。所以大家记住69亿这个官方数字但在讨论战略意图时用130亿来理解“英伟达为这个平台总共押了多少身家”也完全说得过去。真正值得关注的从来不是精确数字而是为什么一家GPU巨头愿意为网络设备公司付出这种级别的代价。1.2 Mellanox到底凭什么值这个钱Mellanox这家公司很多人可能第一次听说。它1999年成立于以色列后来在纳斯达克上市主营业务是高性能网络互连。简单说它就是给数据中心、超算中心修“高速公路”的。它的产品线主要包括四块InfiniBand产品线包括交换机、网卡HCA、线缆模块主要用于超算和AI训练集群。高速以太网产品线包括以太网控制器、交换机芯片、网卡覆盖云计算和企业数据中心。BlueField系列DPU也就是智能网卡/数据处理单元能卸载网络、存储、安全等虚拟化开销。相关软件与固件生态比如网络管理软件、RDMA技术栈、无损网络方案。Mellanox做的是高带宽、低延迟、低CPU占用率的互连解决方案它的InfiniBand在超算领域尤其强势。全球TOP500超算里相当大一部分采用InfiniBand作为节点互连网络。如果GPU是计算引擎那InfiniBand就是连接所有引擎的传动轴。没有这套网络几千块甚至几万块GPU根本没法协同工作。估值的核心逻辑在于Mellanox不光是卖硬件它还掌握着一套事实标准RDMA远程直接内存访问和RoCERDMA over Converged Ethernet协议生态。这意味着它不只是在卖网卡而是在“定义数据怎么流动”。1.3 “平台”的含义网络不是配件是神经系统收购刚公布时有不少人觉得黄仁勋买贵了甚至认为英伟达是在“乱花钱”。这种判断的误区在于把网络当成了和电源、机箱一样的普通配件。但如果你把一个数据中心看成一台计算机事情就完全不一样了。CPU是大脑GPU是肌肉内存是临时记忆而网络是神经系统。肌肉再强壮神经传导速度跟不上整个人也跑不快。AI训练任务尤其依赖神经网络的“传导速度”——几万张GPU卡要同步更新参数只要网络延迟和丢包稍微恶化整体利用率就可能暴跌一半。英伟达以前的策略是专注做GPU网络交给合作伙伴比如Mellanox和博通。问题是随着AI集群越做越大网络已经不只是“打通连接”这么简单它直接决定了算力能不能真正发挥出来。黄仁勋后来反复讲“数据中心即计算机”这句话翻译过来就是英伟达必须同时掌控计算、网络、存储这三大件才能交付一个完整的、用户拿回去就能用的计算平台。所以Mellanox在英伟达的棋盘上不是一个配件商而是一块关键的拼图。买下它英伟达才算真正从“显卡公司”变成“计算平台公司”。2. 黄仁勋的焦虑清单为什么“卖铲人”也要买“修路公司”2.1 算力越强网络短板越致命很多人对AI训练集群的印象是“堆GPU就行了”。但从业者都清楚大规模分布式训练里通信占比高得吓人。拿一个中等规模的模型训练来说数据并行下每轮迭代都要做梯度同步。假设集群有1000张GPU卡每张卡算完各自那一份就需要把梯度汇总分发。这个步骤完全依赖网络。如果网络带宽不够、时延太高GPU就只能蹲在原地等数据算力再强也白搭。业内有个经验值训练效率要想上到90%以上网络必须做到低时延、无丢包、高带宽三者兼备。传统以太网容易出现拥塞丢包一丢包就要重传重传期间GPU继续空转。InfiniBand之所以在超算圈吃香就是因为它是专门为高负载互连设计的天然支持RDMA能在大规模并行场景下把通信效率压到极限。英伟达如果不收购Mellanox就会一直存在一个致命短板GPU是自家造的但连接GPU的网络命脉攥在别人手里。更危险的是如果网络厂商被竞争对手收购英伟达在最核心的数据中心市场就会被卡脖子。这种风险对于一家把数据中心当主业来做的公司来说是不能接受的。2.2 客户自研运动正在拆英伟达的台黄仁勋的焦虑还不止来自网络硬件本身。真正让他坐不住的是整个行业都在掀起一场“自研运动”。大型云厂商和互联网公司过去是英伟达GPU最大的买家。现在呢谷歌有TPU亚马逊有Trainium和Inferentia微软有MaiaMeta也宣布了自己的MTIA还有国内一堆AI芯片公司在追赶。虽然这些自研芯片短期内很难全面替代英伟达但它们已经形成了一个明显的信号大客户不愿意在算力上被单一供应商锁死。更关键的是这些云厂商不只在自研算力还在自研网络。AWS的Nitro系统阿里云的神龙架构本质上都是把网络、存储、安全等基础设施操作从CPU上卸载下来自己做一套完整的软硬件栈。这意味着未来数据中心里的网络互连标准可能走向碎片化。客户一边自研算力一边自研网络另一边还用开源框架降低软件切换成本。这套组合拳打下来英伟达如果只是一个卖GPU的硬件商议价空间会越来越小。但如果英伟达手里有了一张完整的网络平台情况就完全不同了客户可以换掉GPU吗可以但连带着整套InfiniBand/以太网方案、CUDA和网络软件栈都得换切换成本瞬间变得极高。2.3 三块芯片一张网控制欲背后的系统性焦虑黄仁勋这几年反复讲一个概念CPU、GPU、DPU是数据中心的“三块芯片”。这个提法在收购Mellanox之前是没法落到实处的因为DPU恰恰就是Mellanox产品版图里最核心的板块之一。先解释一下DPU是干什么的。在传统数据中心里网络数据包进来后CPU要花大量时间去处理网络协议栈、存储转发、安全加密这些事。这些操作占用CPU算力却不是在跑核心业务。DPU的价值在于把这部分基础设施操作“卸载”掉CPU、GPU只管计算网络、存储、安全交给DPU去处理。Mellanox的BlueField DPU正是这块市场上最成熟的方案之一。英伟达收购Mellanox后迅速把BlueField和DOCA软件框架推向了前台。DOCA的作用相当于CUDA之于GPU给开发者提供一套统一的编程接口让他们能在DPU上卸载各种数据中心任务。这里面的野心很清楚英伟达不只想垄断计算这一环还想控制数据中心里数据流动、存储访问、安全策略这些“基础设施语言”。焦虑的根源就在这里。如果英伟达只做GPU它在数据中心里的角色就是一个配件供应商如果它同时掌握GPU、DPU和网络平台它就是整座数据中心的“操作系统”。收购Mellanox本质上是英伟达为了把控制权从单点延伸到全局。2.4 研发节奏的生死线还有一个常被忽略的焦虑来源研发节奏。GPU的更新周期大概是两年一代但网络技术的迭代同样不等人。200G、400G、800G甚至1.6T的以太网都在快速推进硅光技术、共封装光学、无损网络、超低时延交换机每一个方向都烧钱且烧人。如果这些关键技术掌握在别人手里英伟达就无法精确控制“下一代GPU配什么网络才能达到最佳表现”。举个直观例子新发布一款GPU如果配套网卡还是上一代的带宽用户买回去组集群系统性能就达不到英伟达工程师在演示文档里画的效果。性能兑现不了口碑就会崩。所以为了确保GPU发布时整个系统同步升级英伟达必须有自有网络研发团队。收购Mellanox正好补上了这个节奏缺口。3. 从InfiniBand到DPUMellanox技术怎么变成英伟达的平台护城河3.1 NVLink与InfiniBand两条“高速路”怎么分工很多人会把NVLink和InfiniBand搞混这里我具体讲一下。NVLink是英伟达自己定义的私有高速互连协议最早是用来连接多张GPU的后来发展到连接GPU与CPU、GPU与GPU交换机。它带宽极高、时延极低但传输距离有限主要覆盖一块主板、一个机柜内部甚至是一台机器内部的板间互连。打一个比方NVLink是工厂内部的生产线传送带速度快但不能铺出厂房太远。InfiniBand呢它是一条“城际高速路”。它能把几百个机柜、几万张GPU连在一起形成一个大集群。在英伟达现在的方案里两者的组合是机柜内部用NVLink组网构建出HGX高性能计算域机柜之间用InfiniBand交换机互连组成整个AI集群。比如DGX SuperPOD这类产品就是典型的“NVLink做内部直连 InfiniBand做跨节点互连”。这套组合带来的一个直接优势是英伟达可以在设计GPU时就把网络特性考虑进去而不是把GPU做出来后再看市场上有什么网卡能用。Mellanox的技术融入英伟达的产品规划后整机柜交付方案才真正闭合。3.2 BlueField DPU与DOCA真正值钱的“远期支票”外界讨论最多的是InfiniBand但战略份量最重的可能是DPU业务。BlueField DPU在英伟达的布局里承担的角色是数据中心的“控制面”。它能把虚拟化网络、存储协议、安全网关、负载均衡这些基础设施任务从CPU和GPU身上剥离出来。你可以把它理解成专门处理杂务的总务管家让CPU和GPU专注干主业务。配套的DOCA数据中心基础设施计算架构框架更值得留意。英伟达想把CUDA在GPU上的成功模式复制到DPU上开发者只要会调用DOCA接口就能利用DPU实现网络加速、存储池化和安全隔离。通过这套软件生态英伟达成功把“硬件卖出去”延伸为“标准长出来”。为什么说这是远期支票因为DPU市场需要时间来培养客户不可能一夜之间把整个数据中心架构改成DPU模式。但只要数据中心还要做裸金属、还要搞云原生、还要追求性价比DPU就一定会逐步挤进标配。英伟达埋伏笔的时机非常早而Mellanox刚好又在这个领域积累了十几年硬件经验。这个组合一时半会儿很难被复制。3.3 从卖显卡到卖机柜网络业务如何撑起估值想象收购Mellanox还有一个非常现实的商业目的让英伟达从“卖板卡”过渡到“卖整套系统”。收购完成之后英伟达把Mellanox团队并入数据中心网络事业部产品线快速整合进DGX系列、HGX基板、MGX模块化服务器方案。客户现在面对的已经不是一个只卖GPU的厂商而是能提供“计算网络存储”整套方案的系统厂商。从收入结构也能看出变化。Mellanox在被收购之前的年收入大概在10到15亿美元区间而英伟达近期几个财季的网络业务收入长期保持两位数甚至三位数百分比增长。虽然英伟达没有单独拆分Mellanox的“贡献净利润”但网络业务已经成为数据中心收入里不可忽视的第二曲线。这套打法还有一层好处整柜交付的毛利计算方式变了。单独卖GPU要面对显卡市场价格战但如果你提供的是“人家插上电就能跑AI”的整机柜方案那你占据的就不是硬件利润而是系统利润和服务利润。这就是为什么市场愿意给英伟达更高的估值倍数——它已经不再是一家靠GPU跑量的芯片公司而是像卖“发电厂”一样在卖完整的AI基础设施。4. 一枚棋子落下之后数据中心攻防战的新棋局4.1 英特尔的自救与AMD的追赶Mellanox被英伟达收入囊中最先坐不住的是英特尔和AMD。英特尔的情况最尴尬。它早年其实自己做过高性能互连TrueScale后来放弃了转而在以太网领域布局收购了Barefoot Networks也开始推自己的800G以太网方案。但问题是英特尔在AI计算这块本来就被英伟达压制网络领域也失去了InfiniBand这张牌只能靠以太网硬扛。在英伟达“GPUIBInfiniBand”的组合面前英特尔面临“CPU以太网”这个传统组合能否继续吸引机房客户的问题。AMD这两年的策略非常清晰收购Xilinx之后又收购了Pensando获得了DPU和可编程网络技术。这套组合和英伟达“GPUDPU网络”的思路如出一辙。AMD想证明的是在超算、AI集群里我也有完整的计算网络方案不需要看英伟达脸色。但从生态成熟度看AMD的网络平台与CUDADOCA的组合相比仍然有明显差距。这场军备竞赛的实质是芯片巨头都在争“数据中心操作系统级”的控制权。以前大家拼CPU单核跑分、GPU浮点算力现在拼的是谁能让整台数据中心跑得更顺、更省、更容易部署。4.2 云厂商的“自研网络防线”如果说英特尔和AMD是明面对手那云厂商就是英伟达藏在暗处的对手。亚马逊AWS很早就意识到网络在云数据中心里的战略性自研了Nitro系统把虚拟化、网络和安全卸载到自研芯片上。阿里云的神龙架构也是同一思路把网络和存储I/O从CPU中剥离出来。谷歌不但自研TPU也在网络通信和数据中心互连上做了大量自研优化。微软则通过FPGA和自研硬件来加速网络。这些云厂商自研网络不完全是为了省成本更重要的是想掌控技术栈的演进节奏。一旦网络变成标准化的“公共零件”他们就要被迫接受英伟达定义的互连生态这在商业上等同于把数据中心命脉交给竞争对手。英伟达收购Mellanox客观上给云厂商带来了巨大压力。因为英伟达可以借助InfiniBand和以太网方案向企业客户提供“预集成”的私有化AI集群。这套产品和服务的黏性甚至比在公有云上租GPU还要高。云厂商再怎么自研面对的是英伟达从底层硬件到系统方案的整套攻势。4.3 超算与AI工厂最容易被忽略的扩展性门槛网络互连的重要性在超算领域看得最清楚。全球顶尖超算的排名不只是看CPU/GPU峰值算力还要看互连网络能不能让这么多节点高效协同。TOP500榜单里大量系统用的就是InfiniBand。以前Mellanox是独立供应商谁都能买现在它属于英伟达超算建设方选择Mellanox就等于把一部分技术路线绑到了英伟达的战车上。这个变化还影响到了新兴的“AI工厂”。黄仁勋不止一次公开提到AI工厂本质上是一种新型数据中心它把电力变成智能输出而集群里的每一块GPU都要靠网络喂数据。微软、Meta、特斯拉这类公司建大规模AI集群时面临一个很现实的对比是用全英伟达方案省心稳定还是混搭自研方案以保留弹性事实上很多AI集群项目确实选择了英伟达全家桶。不是说混搭不行而是整合成本和稳定性风险太高。英伟达收购Mellanox等于把这道选择题从“要不要用英伟达的GPU”升级成了“要不要用英伟达定义的数据中心技术栈”。后者做出的决策显然要困难得多。5. 我从这笔交易里提炼出的几条行业判断5.1 别只看峰值算力要看整系统效率很多做深度学习的朋友在搭机器时会有一种“字母表崇拜”显卡要顶配CPU要核心多内存要容量大却很少有人认真想过网络。我这些年看下来单机性能高不代表集群训练效率高。两台装了两块顶级GPU的机器用千兆网卡互联和用InfiniBand或RoCE网卡互联训练效率能差出一大截。尤其是模型并行、数据并行混合的分布式训练场景通信瓶颈直接决定GPU的利用率。Mellanox收购案给我的第一个启示是评估任何计算方案都要把“效率”而不是“峰值”放在第一位。系统恰不恰当木桶最短的那块板才是天花板。5.2 收购的逻辑控制标准而不是控制单一产品普通人看收购注意力往往放在产品上英伟达买了一张网卡产品线英特尔买了一家交换芯片公司AMD买了一家DPU初创。但真正的商业高手看的是标准。Mellanox的核心资产不是某款网卡而是它在高性能互连领域积累的协议栈、开发者生态、客户信任和行业话语权。收购完成后英伟达可以决定哪些新兴标准要支持、哪些要淘汰可以把自家需求写进新一代网络规范里。这种“标准控制者”的身份让它在未来的技术路线竞争中天然占优势。放在个人和团队的语境里也一样与其做一个人人可替代的熟练工不如去掌握那个“连接上下游的协议层”能力——比如通用中间件、数据管道、平台架构设计。掌握了连接和标准你就掌握了主动。5.3 普通团队能用上的“战略焦虑”思维黄仁勋的“怕”让我们看到再强的公司也会有战略焦虑。这种焦虑不是恐慌而是一种提前计算过的风险规避。对普通工程师或者创业团队来说可以这样实践定期盘一下当前最依赖的外部供应商或技术环节有哪些如果哪天它不供了或者涨价了或者被竞争对手买走了你的项目会不会停摆如果会那就该提前布局替代方案或者在技术上加深理解甚至把这项能力内化。我在读完英伟达整合Mellanox的完整过程之后最大的感受是真正厉害的决策往往不是为了眼下的增长而是为了堵住未来可能出现的那个“三到五年的漏洞”。买一个市场领先的平台级公司不是因为它便宜而是因为它能让你的核心系统在下一轮技术升级里不掉队。这个思路放在任何领域都通用。无论是个人做技术选型、创业公司做战略规划还是大厂做生态投资最该关注的不是“谁现在最强”而是“谁掌握着通往下一阶段的必经之路”。
返回列表