ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从谷歌122亿美元选择权看AI芯片竞争:软硬一体与生态掌控

从谷歌122亿美元选择权看AI芯片竞争:软硬一体与生态掌控 最近几年AI芯片领域的新闻常常是“某某公司发布新一代芯片性能提升X倍”或者“某某巨头自研芯片挑战英伟达”。这类消息看多了容易让人产生一种错觉芯片竞赛就是一场纯粹的“性能军备竞赛”谁算力强、参数高谁就赢了。但最近看到一条不太一样的消息Marvell美满电子给了谷歌一个选择权允许谷歌在未来以高达122亿美元的价格收购其部分业务作为双方TPU合作的一部分。这条新闻没有直接说性能也没有提参数而是谈到了“选择权”和“收购”。这让我停下来想了一会儿。这背后其实指向了一个更本质的问题在AI基础设施这场长跑里巨头们真正在争夺的到底是什么是单颗芯片的峰值算力还是对整个计算栈的掌控力是短期的性能领先还是长期的供应链安全和生态壁垒Marvell是一家老牌的芯片设计公司尤其在数据中心网络、存储和定制化芯片领域有深厚积累。谷歌的TPU张量处理器则是其AI战略的基石从云端推理到训练再到边缘设备已经形成了庞大的家族。这两家的合作显然不是简单的“甲方买乙方芯片”的买卖关系。一个“选择权”条款的曝光更像是在揭示一种更深层次的绑定和战略对冲。今天我们不聊枯燥的财务细节也不做空洞的行业预测。我想从一个一线工程师和观察者的角度聊聊这件事背后折射出的几个关键趋势为什么AI巨头越来越倾向于“软硬一体”当性能不再是唯一瓶颈时芯片竞争的焦点转移到了哪里以及像谷歌这样的公司通过一个“选择权”究竟想锁定什么未来理解这些或许比单纯比较TPU和GPU的FLOPS浮点运算次数更有价值。1. 从“买芯片”到“定义芯片”AI时代计算范式的根本转变要理解Marvell和谷歌这笔交易的意义首先要跳出“芯片即商品”的传统思维。在过去的信息时代英特尔和AMD的x86 CPU、英伟达的GPU某种程度上都是标准化的“商品”。大多数公司包括谷歌早期都是采购这些现成的硬件然后在其上搭建软件和业务。但AI特别是大规模深度学习彻底改变了游戏规则。1.1 为什么通用芯片开始“不够用”了这并不是说GPU不好。恰恰相反英伟达的CUDA生态和GPU的并行计算能力是过去十年AI爆发的核心引擎。但问题在于通用性必然伴随着效率的折损。你可以把传统的CPU/GPU架构想象成一把“瑞士军刀”。它功能全面能应对各种任务科学计算、图形渲染、通用计算等但当你日复一日地只用它来执行“切面包”这同一个动作时你就会发现专门设计一把更趁手、更省力的“面包刀”是值得的。AI计算尤其是神经网络的训练和推理其计算模式具有高度的规律性和特异性大量的矩阵乘加运算MatMul、特定的数据精度FP16/BF16/INT8、对内存带宽的极致渴求。通用GPU为了保持灵活性内部有大量晶体管和电路用于处理分支预测、复杂调度等任务这些对于纯粹的AI计算负载来说成了“不必要的开销”。于是像谷歌TPU这样的ASIC专用集成电路应运而生。它砍掉了所有与张量计算无关的部件将几乎所有的芯片面积和功耗都用于执行矩阵运算实现了极高的能效比和计算密度。对于谷歌这样运行着全球最大规模AI工作负载的公司来说哪怕每瓦特性能提升10%一年节省的电费都是天文数字。1.2 “软硬一体”不是口号是生存刚需然而只做一颗高效的AI芯片是远远不够的。芯片的效能严重依赖于与之配套的软件栈、编译器、运行时库乃至上层的框架如TensorFlow、JAX。这就是“软硬一体”的真正含义硬件为软件的最佳表达而设计软件为硬件的特性而深度优化。软件定义硬件谷歌的AI研究人员用TensorFlow或JAX定义模型。这些框架的底层算子Operation会如何被调度、计算图Graph如何被优化直接影响了芯片内部计算单元、内存层级和互联的设计。如果芯片设计团队不深度参与软件生态的建设做出来的硬件很可能无法充分发挥框架的能力。硬件赋能软件反过来TPU硬件支持的一些独特特性如特定的数据布局、稀疏计算单元也需要在编译器如XLA和运行时层面得到支持才能暴露给上层的开发者使用。这是一个紧密的反馈循环。Marvell在这其中的角色非常关键。它并非一个从零开始的挑战者而是一个顶级的“芯片定制化伙伴”。它拥有成熟的高速SerDes串行器/解串器技术、网络互联IP、以及大规模SoC系统级芯片的设计和交付能力。谷歌可以与Marvell的工程师坐在一起基于TPU的核心架构共同定义下一代芯片需要什么样的片上网络NoC、什么样的高带宽内存HBM接口、什么样的PCIe或更先进的裸片间互连。这个合作模式本质上是从“采购标准件”转向了“联合研发定制件”。Marvell提供的是顶尖的工程实现能力和IP组合谷歌提供的是对自身AI工作负载的深刻理解和软件栈的最终定义权。2. 122亿美元“选择权”的背后锁定供应链与能力壁垒新闻中最引人注目的无疑是“122亿美元”这个数字。这不是一笔小钱即使对谷歌而言。这个“选择权”Option协议远比一份普通的长期供货合同要复杂和深刻。2.1 它首先是一份“风险对冲”契约半导体行业尤其是先进制程如5nm、3nm芯片的制造是资本、技术和时间高度密集的行业。流片Tape-out费用动辄数亿美元从设计到量产周期长达18-24个月且充满不确定性。对于谷歌来说TPU是其AI基础设施的战略核心。如果完全依赖内部团队或单一外部伙伴会面临巨大风险技术路线风险内部团队可能无法在预定时间内攻克所有技术难关。供应链风险芯片制造、封装、测试的任何一个环节出现瓶颈如产能不足都会直接影响谷歌云AI服务的交付和成本。人才竞争风险顶尖的芯片设计人才是全球性稀缺资源。通过与Marvell签订带选择权的深度合作谷歌实现了多重对冲确保产能与交付通过资本绑定谷歌能获得Marvell产能和工程资源的优先保障在行业产能紧张时尤为关键。降低研发风险联合研发分摊了部分前沿探索的成本和风险。如果某条技术路径走不通双方可以共同调整。获得外部视角Marvell作为服务多家客户的芯片设计公司能带来更广泛的行业视野和最佳实践避免谷歌内部团队陷入“闭门造车”。2.2 更深层的是在构建“生态护城河”AI芯片的竞争中长期来看是生态的竞争。英伟达的护城河不仅是GPU硬件更是CUDA、cuDNN、TensorRT等构成的庞大软件生态。任何新玩家都要面对“先有鸡还是先有蛋”的困境没有用户就没有生态没有生态就吸引不了用户。谷歌的路径有所不同。它利用自身庞大的内部需求搜索、广告、YouTube、Waymo等和谷歌云GCP的对外服务从一开始就为TPU创造了一个“保底”的规模化应用场景。这使得TPU的迭代和软件栈的优化有一个强大而稳定的反馈闭环。那么Marvell的选择权在这个生态中扮演什么角色它是在加固这个闭环的“硬件底座”。通过锁定与Marvell的长期合作谷歌确保了其TPU硬件路线图的连续性和可控性。下一代TPU需要什么样的互联技术来支持万卡集群需要什么样的内存架构来应对万亿参数模型这些前瞻性的定义需要芯片设计伙伴的长期投入和信任。选择权协议正是建立这种长期信任的金融和法律工具。这相当于谷歌在说“Marvell我们一起投入资源定义未来。如果合作顺利我们的绑定会更深我可能直接买下这部分业务同时你也因为与我的深度绑定而成为AI芯片定制化领域的顶级玩家。” 这是一种战略同盟目的是共同构筑一个外部竞争者难以在短期内复制的、从硬件到软件的全栈能力。3. 对开发者与行业的影响从“黑盒”到“可预期”的基础设施作为使用AI基础设施的开发者或企业我们可能永远不需要关心芯片内部的晶体管如何排列。但巨头们的这些动作最终会像涟漪一样影响到我们工作的每一个层面。3.1 性能与成本的“可预测性”提升当AI计算的基础设施芯片、互联、软件栈由少数几家巨头深度定制和优化后其性能提升的轨迹会变得更加线性化和可预测。这听起来可能有点反直觉但想想看如果谷歌每年都基于与Marvell的合作稳定地推出新一代TPU每代在能效比和互联带宽上提升一个可预期的百分比那么谷歌云在规划其AI服务如Vertex AI的定价和算力供给时就会有更强的底气。对于开发者而言这意味着你可以更可靠地预估训练一个大型模型的成本和耗时从而更好地规划研发预算和产品上线时间。相比之下如果依赖一个波动较大的通用硬件市场这种长期规划会困难得多。3.2 软件栈的“垂直整合”趋势随着谷歌、AWS拥有Graviton和Trainium/Inferentia、微软与AMD、英伟达深度合作并自研Maia等云厂商在自研芯片上越走越远一个明显的趋势是云服务的软件栈和底层硬件会结合得越来越紧密。未来在谷歌云上跑AI最顺畅、性价比最高的路径可能就是使用TensorFlow/JAX框架 - 通过XLA编译器优化 - 运行在TPU Pod上。整个链路都经过了谷歌的深度优化。这可能会带来一些“锁定”效应但同时也可能提供最佳的端到端体验。对于开发者这意味着最佳实践可能变得“平台特定”在GCP上用TPU的最佳代码写法可能与在AWS上用Trainium或在Azure上用ND H100实例有所不同。抽象层变得更重要像PyTorch这样的框架其价值之一就在于能在一定程度上抽象底层硬件。但为了榨干硬件性能深入到底层框架和编译器层面进行调优可能会成为高级AI工程师的必备技能。选择成本增加企业需要更慎重地评估是追求极致的性能和成本选择某家云的全栈方案还是保持灵活性和可移植性使用更通用的硬件和框架。3.3 创新门槛与机遇并存巨头们重金投入自研芯片拉高了AI基础设施的竞争门槛。创业公司几乎不可能再从头开始设计一款有竞争力的训练芯片。这似乎挤压了创新空间。但从另一个角度看它也创造了新的机遇专用化芯片的细分市场大模型训练是主战场但在边缘推理、自动驾驶、科学计算、生物信息等细分领域仍有大量对特定计算模式优化的芯片需求。这些可能是新兴公司的机会。IP和设计服务市场繁荣正是因为有谷歌这样的“大客户”需求才养活了像Marvell这样的顶级芯片设计服务公司。这个生态本身就在催生创新。开源硬件与软件虽然高端芯片封闭但RISC-V等开源指令集架构正在让更多玩家能够参与到基础计算组件的创新中。谷歌也可能将部分非核心的硬件接口或软件工具开源以繁荣其生态。4. 给技术决策者的启示如何应对“软硬一体”的新世界面对这样一个正在被巨头重塑的AI基础设施版图无论是个人开发者、技术团队负责人还是企业CTO都需要调整我们的认知和策略。4.1 建立“算力经济学”思维不要再把算力单纯看作一种采购成本。要建立“算力经济学”思维将其视为一个包含性能、成本、效率、弹性、长期可维护性的综合决策模型。在评估算力方案时可以问自己以下几个问题评估维度关键问题思考方向绝对性能单卡/单芯片的峰值算力TFLOPS是多少重要但非唯一指标。需结合模型类型和框架看实际利用率。实际效率在我的工作负载和软件栈下能发挥出硬件标称性能的百分之多少比峰值性能更重要。需要实际基准测试。关注内存带宽、互联延迟的影响。总拥有成本包含硬件采购/租赁、电费、冷却、运维人力在内的总成本是多少自研芯片如TPU往往在能效上有优势能显著降低大规模部署的TCO。生态适配我主要的AI框架PyTorch/TensorFlow和模型在该硬件上的支持度和优化程度如何避免选择生态羸弱的硬件否则调试和优化成本会极高。弹性与弹性我能多快获得算力能否随时扩缩容云服务提供弹性但可能价格较高。自建集群弹性差但长期成本可能更低。长期路线图该硬件供应商的未来发展计划是否与我的业务方向一致像谷歌-Marvell这种深度合作提供了更可预期的升级路径。4.2 拥抱抽象但理解底层对于大多数团队我建议采取“拥抱高层抽象但保持对底层的理解”的策略。日常开发优先使用成熟的云AI平台如Vertex AI, SageMaker, Azure ML或容器化服务。它们封装了底层硬件的复杂性让你能快速聚焦于模型和业务逻辑。性能调优当遇到性能瓶颈时再深入一层。学习使用平台提供的性能剖析工具Profiler理解你的模型在特定硬件无论是TPU还是GPU上的计算、内存和通信瓶颈在哪里。这时对底层硬件架构的基本了解如内存层级、计算单元类型、互联拓扑会非常有帮助。框架选择保持对主流框架的跟踪。目前PyTorch在学术界和工业界势头强劲生态丰富TensorFlow/JAX与谷歌硬件栈结合最紧密。根据团队技能和项目需求选择不必盲目跟风。4.3 将“供应商管理”升级为“伙伴关系评估”如果你所在的企业对算力有长期、大规模的需求例如每年数千万美元的投入那么与算力供应商的关系就不能再是简单的“买卖”关系。需要考虑更战略性的问题技术协同供应商是否愿意与你分享其硬件路线图能否针对你的特定工作负载进行联合优化成本结构是否有机会达成长期的、基于承诺用量的优惠协议类似谷歌-Marvell的选择权协议虽然规模不同但思路可以借鉴通过长期承诺来锁定优惠价格和供应保障。风险共担在尝试前沿硬件如新一代芯片的早期试用时能否与供应商建立共担风险的机制Marvell和谷歌的这笔交易最终反映了一个清晰的趋势AI时代的竞争正在从单点的“芯片性能竞赛”演变为贯穿芯片设计、软件栈、平台生态、供应链安全乃至资本合作的全栈式、体系化竞争。122亿美元的选择权买的不仅仅是一部分芯片业务更是通往下一代AI计算时代的、一张优先级更高的船票。对于我们这些航行在AI浪潮中的开发者而言看清巨轮的航向不是为了登上某一艘特定的船而是为了更好地驾驭自己的风帆在变化的海域中找到最有效率的航道。
返回列表