
1. 480GB显存是什么量级先和主流产品摆在一起算笔账英特尔这次公开的AI推理GPU细节最抓眼球的就是显存最高480GB这个数字。单卡480GB显存是什么概念目前市面上你能买到的消费级旗舰显卡RTX 4090是24GBRTX 5090是32GB专业级的L40S是48GB即使是上一代数据中心训练主力H100也不过80GB HBM3AMD的MI300X做到了192GB HBM3这已经是当前单卡显存的头部水平了。英特尔这颗推理GPU直接把显存拉到480GB是H100的6倍是MI300X的2.5倍这个差距不是挤牙膏式的迭代而是完全换了一条技术路线。1.1 主流AI加速卡显存规格盘点先列一张表把当前主流产品的显存配置摆在一起看这样对480GB的冲击感会更直观产品显存容量显存类型带宽定位NVIDIA H100 SXM80GBHBM33.35TB/s训练/推理NVIDIA H200141GBHBM3e4.8TB/s训练/推理NVIDIA B200192GBHBM3e8TB/s训练/推理AMD MI300X192GBHBM35.3TB/s训练/推理英特尔 Gaudi 396GBHBM2e3.7TB/s训练/推理英特尔 AI推理GPU曝光最高480GB非HBM未披露推理从这张表能看出两条脉络一是头部产品都在往更大显存走但HBM的成本和产能摆在那里每翻一倍显存都要付出巨大代价二是所有主流加速卡的显存容量都没有跳出用HBM堆容量这个框架。英特尔这次直接砍掉HBM转而用另一种方式把显存做到480GB这等于在怎么给AI芯片配内存这个问题上给出了一个和NVIDIA、AMD完全不同的答案。1.2 480GB和训练卡的核心差异在哪里很多人一看480GB第一反应是这卡训练肯定猛。这个直觉恰恰是错的。英特尔的定位写得很清楚AI推理GPU。训练和推理对显存的需求逻辑完全不同。训练时你看重的是单次迭代能塞多大的batch size显存越大batch越大GPU利用率越高训练越快。但训练卡通常不需要装下完整的模型权重——它需要的是足够的空间容纳梯度、优化器状态、激活值以及不断流动的训练数据。所以训练卡的显存需求计算的是中间状态有多大。推理不一样。推理时模型权重是静态的加载进显存之后就一直留在那里。你要服务一个70B参数的模型FP8精度下光权重就要70GB再算上KV cache和推理过程中的激活缓冲区起步就是80GB往上。更关键的是推理服务往往是多模型并发、多租户隔离的一个推理节点如果显存足够大就能把多个模型同时驻留在显存里按需切换不用频繁从硬盘加载权重。480GB意味着这台机器可以同时常驻好几个百亿甚至千亿参数级别的模型这对推理服务的弹性来说是一个质变。所以英特尔这颗GPU本质上不是在跟NVIDIA拼谁的训练卡更强而是在回答一个问题当模型权重越来越大、推理并发越来越高单卡显存到底该做到多大才够用它的答案是至少480GB。2. 放着HBM不用英特尔到底在打什么算盘这可能是整篇报道里最值得琢磨的信息点480GB显存但不用HBM。在大多数人的认知里AI加速卡和HBM基本上已经画上等号了NVIDIA从A100到H100到B200AMD从MI250到MI300XHBM是标配。英特尔自己上一代Gaudi 3用的也是HBM2e。为什么这颗推理GPU反而要把HBM从清单里划掉2.1 推理负载对带宽的真实需求要理解这个决策先得算清楚推理和训练在带宽需求上的差异。训练是典型的数据搬运密集型任务每轮迭代都要把权重、梯度、优化器状态全部读写一遍而且要批量处理大量样本带宽直接决定训练吞吐。所以训练卡拼命堆HBM的高带宽H100的3.35TB/s就是这么来的。推理的逻辑完全不同。推理的token是逐个生成的每个token只依赖前一个token的KV cache数据局部性非常强。单次推理请求对带宽的消耗远低于训练它更依赖的是两样东西显存容量够不够把所有模型权重装下以及模型本身的算子执行效率。推理时的瓶颈更多在计算单元上而不是在显存带宽上。拿一个实际场景算以FP8精度跑一个70B模型H100的3.35TB/s带宽理论上一秒钟能读取约40GB权重也就是可以完成大约40/70的全量权重扫描。但推理根本不需要每秒对全量权重做几次扫描真正需要的是把权重稳定放在显存里在生成每一个token时精准读取相关的那一部分。对推理来说容量够大比带宽够快更解渴。2.2 HBM的价格、产能和功耗三重约束那HBM是不是就一无是处当然不是。HBM的高带宽是实打实的但它有三个绕不开的硬伤这三个硬伤在推理场景里被放大了。首先是价格。HBM的制造工艺极其复杂它本质上是把多颗DRAM die通过TSV硅通孔技术垂直堆叠再通过2.5D封装和GPU die放在同一块硅中介层上。这个工艺良率低、产能有限价格常年是普通DRAM的好几倍。如果英特尔用HBM堆到480GB物料成本会高到一个完全没法在推理市场铺开的价格直接被NVIDIA按在地上摩擦。其次是产能。这不是秘密HBM的核心供应掌握在SK海力士、三星、美光手里产能被训练卡订单占得满满当当。英特尔这时候再去抢HBM产能既抢不过NVIDIA也抢不出规模优势。最后是散热和功耗。HBM高带宽的代价是高功耗HBM3的单颗功耗轻松突破10W一套GPU插满HBM之后散热设计复杂度会急剧上升。推理集群是典型的高密度部署场景一颗芯片如果能把显存功耗压下来整个机柜的功耗预算就能省出一大块。英特尔不做HBM不代表它不要带宽它的意思是我在推理负载的带宽需求范围内用更低成本、更大容量、更可控的供应链去把显存堆起来。这是一个非常务实的成本账。2.3 不用HBM之后替代路径是什么480GB不用HBM那用什么目前能匹配这个容量规模的显存介质基本就两条路一条是LPDDR或GDDR这类更成熟的DRAM方案。它们不需要TSV堆叠不需要硅中介层封装难度低供应链成熟成本只有HBM的零头。代价是带宽比HBM差一个数量级但对推理来说这个带宽降级是可以接受的只要容量够大、成本够低整体性价比反而更高。另一条是更激进的内存池化方案比如通过CXL接口把多台机器的内存池化给GPU用。480GB可能是板上显存池化内存的总和也可能重点在CXL内存扩展。这条路的好处是容量几乎不受物理限制坏处是跨设备的访问延迟会显著高于本地显存对推理这种实时性要求高的任务只能用在特定场景。从英特尔最高480GB的措辞来看这应该不是一个单一配置而是同一颗GPU搭配不同显存容量的系列化设计。低配版本可能用较少的内存颗粒高配版本直接堆满480GB让用户根据模型规模和业务需求按需选配。这个思路本身就非常推理既然推理负载的显存需求五花八门那就做一个能灵活扩展显存容量的硬件平台而不是一张卡只有一个固定配置。3. DRAM、NAND、HBM到底差在哪显存技术全景拆解聊到这里有必要把显存相关的基础概念彻底捋一遍。网上总能看到DRAM、NAND、HBM、GDDR这些东西混着说实际上它们是完全不同的存储介质价格、带宽、延迟、寿命差异巨大。搞清楚这些你才能理解英特尔这个方案为什么不离谱也才能理解为什么其他人堆显存普遍用HBM而英特尔反着来。3.1 三类存储介质的物理边界DRAM动态随机存取存储器是我们最熟悉的电脑内存。它的特点就是快纳秒级延迟可以按字节随机读写但必须持续刷新才能保持数据断电即失。DRAM的密度、成本和带宽都可以通过工艺迭代不断提升而且上下游产业链非常成熟是显存最稳妥的基础选择。NAND Flash闪存是硬盘的存储介质。它的特点是密度极高、成本极低、断电数据不丢但延迟在微秒到毫秒级别比DRAM慢几个数量级而且有写入寿命限制。NAND永远不可能当显存用但它是显存不够硬盘来凑这个方案里垫底的最终兜底。HBM高带宽存储器本质上是DRAM的进阶版把多层DRAM die垂直堆叠起来通过硅通孔和GPU封装在一起用超宽的接口换取极高的带宽。HBM的延迟和DRAM差不多但带宽是普通DRAM的好几倍代价是成本飙升、产能有限、封装难度大。这三者的关系用大白话讲DRAM是跑车快但座位少NAND是大巴车便宜能装但跑得慢HBM是改装跑车更快但极其昂贵。3.2 显存堆叠和封装工艺的限制HBM贵就贵在它的堆叠和封装工艺上。普通DRAM是平面铺在基板上HBM是三维堆叠——8层、12层、16层DRAM die用TSV打孔垂直叠在一起再把叠好的cube通过微凸点和GPU die一起放在硅中介层上。这个硅中介层本身就要消耗好几层光罩良率随着面积增大急剧下降所以HBM的单价一直压不下来。英特尔如果走普通DRAM路线做480GB需要的是把足够的DRAM颗粒分布在GPU die周围通过传统的封装基板走线互联。这不会用到硅中介层封装成本和良率风险都要低得多。代价是每颗DRAM颗粒的接口宽度没办法做到HBM那么夸张带宽上不去。但好消息是对推理场景来说这个带宽已经够用。3.3 480GB显存的几种可能实现方式基于上面的技术边界英特尔这颗GPU实现480GB显存无外乎三种组合纯DRAM平面扩展在GPU基板上塞大量GDDR颗粒或LPDDR颗粒类似消费级显卡的做法但颗粒数量大幅提升。这是最直接的方案成本可控但受限于基板面积和布线密度480GB已经是极限。DRAM CXL池化GPU板载一部分DRAM再通过CXL接口把系统内存池化进来操作系统和推理框架看到的总体可用显存是480GB。这个方案的弹性更大但跨CXL的访问延迟会比本地显存高需要软件层做针对性的缓存策略。DRAM NAND分层存储把热权重放进DRAM冷权重放在NAND或SSD上推理时按需换入换出。这个方案本质上是在赌模型权重访问有局部性但大多数LLM推理是串行生成token的权重访问并不像数据库那样有明显的冷热分区所以这种方案在LLM推理里并不实用更可能用在偏数据处理的场景。组合下来英特尔最可能的做法是前两种结合本地DRAM为主CXL池化作为扩展。光靠本地DRAM堆到480GB对基板设计和功耗的要求都不小加上CXL可以大幅降低板级设计的压力。4. 480GB显存能跑多大的模型动手算一算推理显存需求回到最实际的问题480GB显存到底能跑什么规模的模型这个问题不该拍脑袋我给出一个可以直接套用的估算公式和几个主流模型的实测思路你自己拿笔算一算就能得出答案。4.1 从参数规模到显存占用的完整公式推理时的显存占用主要由四部分构成显存需求 ≈ 模型权重 KV Cache 激活值缓冲区 框架运行开销模型权重 参数量 × 每参数字节数。FP32是4字节FP16/BF16是2字节FP8是1字节INT4是0.5字节。KV Cache 2 × 层数 × 隐藏维度 × 序列长度 × batch大小 × 每元素字节数。这部分的计算比较复杂粗略估算时可以直接按权重大小的20%~50%预留。激活值缓冲区推理时按层计算峰值不高预留几个GB即可。框架运行开销CUDA/PyTorch等运行时几个GB到十几个GB不等。拿最常见的70B模型举例比如Llama 3 70B、Qwen 72B这些精度权重占用加KV Cache后估算结论FP16/BF16140GB170GB单卡480GB轻松FP870GB90GB单卡480GB毫无压力INT435GB50GB单卡480GB甚至可以多模型并发再看更大规模的模型规模FP8权重加KV Cache后估算480GB能否单卡70B70GB90GB能130B130GB160GB能300B300GB360GB能671B如DeepSeek MoE671GB激活仅部分取决于稀疏度勉强配合量化可试如果是MoE架构情况又不一样。MoE模型虽然总参数量大但每次推理只激活一部分专家权重可以全部放显存但实际参与计算的是子集。480GB足够把几百B级别的MoE模型权重完整加载这对推理服务商来说是实打实的好处。4.2 主流模型的显存占用实测思路你不需要真的买卡才能估算有两个方向可以提前验证一是用GGBGeneralized Global Buffer或业界常用的显存分析工具读模型配置文件里的层数、隐藏维度、注意力头数套公式硬算二是用已有的推理框架vLLM、SGLang在本地小显存卡上以低精度跑一个小模型按比例外推。当然理论算出来的数值和实际运行还有差距因为推理框架还有缓存分配策略、continuous batching的KV Cache复用、以及PagedAttention这类技术的影响。但大方向不会变480GB对当前绝大多数开源模型都是单卡直接完整加载还能同时跑多个的级别。4.3 显存不够硬盘来凑的现实意义热搜词里有一条qwen3.8 flash next 显存不够硬盘来凑这个现象在推理部署里真实存在。模型权重放不下显存时不少团队会退而求其次把部分权重放SSD推理时按需读入。这个方案的问题是SSD延迟太高即使NVMe SSD的随机读取延迟也只有几十微秒比DRAM的几十纳秒差了三个数量级。每个token的生成都要经过权重读取的话每秒能生成的token数会直线下降体验完全没法接受。480GB显存的意义恰恰在于它把显存不够硬盘来凑这个妥协方案直接消灭了。大模型权重全程驻留显存推理延迟保持在毫秒级不用赌SSD的缓存命中率也不用写复杂的分层调度代码。这套体验对推理服务商来说是实打实的降本增效。5. 部署视角这么一张卡适合什么场景、有什么坑硬件参数再好落不了地也是白搭。从部署角度看480GB非HBM推理GPU的优势和短板都很突出我按自己的实际使用经验把它适合和不适合的场景分开讲。5.1 适合大规模批次推理和聚合推理服务480GB显存最大的价值在于单卡容载量。推理服务商最常见的需求是一台机器尽可能多跑几个模型或者跑一个超大规模模型。显存够大一台8卡机器就能同时服务多个千亿级模型不用在多个节点之间做模型分发和负载均衡。这在规模化运营时能省下一大笔网络设备和运维成本。另外连续批处理continuous batching也吃显存。推理框架为了提升吞吐会把多个请求动态拼在一个batch里batch越大KV Cache消耗越高。480GB意味着可以开很大的batch而不爆显存这对高并发在线推理场景非常友好。5.2 不适合什么场景长序列推理的极致延迟敏感场景如果业务要求极低的单token延迟比如实时语音交互带宽不足的短板会被放大。肚子里的权重虽然够大但读取速度不如HBM极端情况下生成延迟会拉开差距。训练/微调场景训练对带宽和中间状态读写要求极高这颗GPU的定位是推理不是训练硬拿它做训练会是灾难。单模型极小、追求单卡最低功耗的场景如果业务只是跑一个7B小模型480GB显存只会白白增加空载功耗不如选个小显存卡。5.3 生态和软件栈是最大的变数硬件说完了真正决定这颗GPU生死的其实是软件。英特尔在AI推理的软件栈上一直在推OpenVINO、PyTorch的Intel Extension以及oneAPI这套工具链。方向上没问题但和NVIDIA的CUDA生态比差距不是一天两天能追上的。对部署团队来说这意味着两件事一是如果你的推理服务已经重度依赖CUDA生态比如用了TensorRT、Triton Inference Server迁移到英特尔平台要做不少适配工作二是如果你的推理链路刚起步没有历史包袱直接基于PyTorch OpenVINO跑反而有机会把这颗GPU的显存优势吃满。毕竟对推理来说框架适配的熟练度比裸算力更影响最终效果。还有一个容易被忽略的点是显卡互联。GPU互联如果还停留在PCIe Gen4/Gen5阶段多卡之间的通信带宽会明显低于NVIDIA的NVLink。推理场景虽然不像训练那样重度依赖卡间通信但多卡服务同一个超大模型时跨卡KV Cache同步还是会有压力。英特尔的部署文档里如果能把多卡推理的通信开销控制在合理范围这个产品才算真正立住了。6. 我的一点判断作为一个长期和推理部署打交道的人我看到这条新闻的第一反应不是480GB好大而是这个方向终于有人认真做了。业界这几年都在堆HBM带宽但推理市场的真实痛点早就不是带宽不够而是单卡显存放不下模型、部署成本降不下来。英特尔放弃HBM做480GB本质上是把推理场景的容量焦虑放到第一位去做产品定义。当然这颗GPU最终能不能被市场接受还是要看三点价格能不能打到HBM方案的一半以下、软件栈的迁移成本有多大、以及真实推理吞吐能不能在各类模型上跑出让人信服的数字。如果这三点都过关那它很可能成为推理市场的一条鲶鱼倒逼其他厂商重新审视HBM是不是唯一解这个问题。对正在做技术选型的团队我的建议是不要急着跟风先拿你自己的模型和流量分布跑一遍显存估算再决定走HBM路线还是大显存路线。硬件是工具能把成本打下来、把延迟稳住才是王道。480GB这个数字至少给了推理部署一个之前没有的大容量选项这是好事。