ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DC-DC电源调节器:从源头降低数据中心散热成本

DC-DC电源调节器:从源头降低数据中心散热成本 提到数据中心散热成本优化大家最先想到的是什么液冷、冷热通道隔离、提高冷冻水温度、夜间自然冷……这些东西我当然也做过但今天我想聊一个反着来的视角从电源转换效率入手把发热源头直接掐断一部分。这个思路对应的正是标题里那句话——DC-DC Power Regulator Eases Data Center Cooling Costs。DC-DC电源调节器不是散热设备但它对散热成本的影响很多时候比换一套先进制冷方案还要直接。很多人会下意识觉得散热成本高就该在制冷系统上找办法。但实际上一台服务器里电能从市电进入经过UPS、PDU、电源模块、板级DC-DC一路走到CPU/GPU核心中间每一次转换都在掉电掉出来的电几乎百分之百变成热。也就是说散热系统处理的很大一部分热量根本不是计算本身产生的而是电源转换过程中的“额外收费”。你省下这部分浪费制冷端自然就轻松了电费单和PUE数据都会跟着变。这篇文章我会从DC-DC调节器在整个供电链路中的角色讲起把它的效率差异换算成实际的电费和散热负荷最后落到工程落地时怎么选、怎么测、怎么部署。适合做数据中心运维、算力基础设施规划以及服务器硬件选型的同学参考特别是那些每天被PUE和电费追着跑的人。1. 服务器里的电是怎么一步步变成热量的一趟从市电到芯片的旅程要理解DC-DC调节器为什么能影响散热成本得先把服务器里电的“旅行路线”看清楚。很多资料上来就讲效率、讲拓扑但没说明白电到底是在哪个环节丢掉的丢掉之后又去了哪里。这一节我会从头捋一遍。1.1 从市电到芯片要经历几次转换数据中心机房接到的是高压市电通常在10kV或35kV等级经过变压器降到400V再进入UPS做不间断保障然后通过PDU分配到机柜。到了机柜里服务器内部的电源模块PSU先把交流电整流成直流输出电压一般是12V。到这里还是服务器层面的事情接下来才是DC-DC调节器的主场。12V直流电进入主板之后不可能直接给CPU、内存、SSD用。CPU核心电压根据负载和频率通常在0.8V到1.5V之间动态变化内存是1.2V左右SSD主控可能是3.3V或5V。要从12V降到这些电压就得靠主板上的DC-DC降压转换器也就是我们常说的VRMVoltage Regulator Module现在主流方案是多相降压架构。你仔细看CPU插座周围那一圈密密麻麻的电感和电容那就是每一相DC-DC的核心元件。这个过程的本质是输入功率等于输出功率加上损耗。如果今天某个转换器效率是93%那就意味着每送100W给CPU实际要消耗约107.5W输入功率多出来的7.5W变成热。刚才说的每一级转换都是这个逻辑PSU是一次AC-DC转换VRM是一次DC-DC降压中间还有一些辅助的DC-DC给风扇、网卡、硬盘供电。1.2 为什么最后一公里被单独拎出来说有人可能会问PSU的效率这几年已经做到金牌、铂金甚至钛金级96%以上的效率也不罕见为什么还要盯着DC-DC不放原因有两点。第一PSU只负责把交流变成12V直流它管不到12V之后的电压转换第二正是最后这几步DC-DC降压因为降压比大、电流大、开关频率高反而成了服务器内部发热最集中的地方之一。举个例子CPU工作电压1V左右从12V降到1V降压比是12:1。降压比越大占空比越小开关损耗和导通损耗的平衡越难做。再加上CPU的负载瞬变极快——从空闲到满载可能只需要几十微秒——VRM必须用多相交错并联的方式去满足瞬态响应。相数越多控制越复杂损耗控制难度也越高。所以实际情况是服务器内部这些板级DC-DC的效率远没有PSU那么亮眼。老一些的服务器设计VRM全负载效率能做到85%~88%已经不错现在的数字多相方案普遍在90%~93%再往上做到95%~97%就需要在器件、驱动、控制算法、布局布线上下很多功夫了。标称效率看起来只差三五个点放到几千台服务器的规模上就是几十上百千瓦的差距而这些差距最终都变成热量进了机房。1.3 被浪费的电最后都变成了冷负荷这里有个非常重要的工程技术常识在数据中心里电能损耗不等于“消失”它是以热的形式从器件表面散发出来然后变成空调系统必须处理的冷负荷。以一个双路CPU服务器为例如果两个CPU的VRM总损耗是100W这100W就会通过散热器和风扇排到机柜后方。机房空调要做的就是把包括这100W在内的所有热量搬到室外去。搬运热量的过程本身也要耗电循环风机要转、冷冻水泵要转、冷机或冷却塔要工作这些设备的耗电量和它们搬运的热量大致成正比。行业内习惯用PUE来衡量这个比例。PUE是总用电除以IT设备用电一个PUE为1.3的数据中心意味着IT设备每消耗1W电整个机房要消耗1.3W多出来的0.3W就是供电和散热系统的损耗。换句话说在PUE 1.3的情况下IT端每省1W电总电费能省1.3W同时机房里的发热量也少了1W。DC-DC调节器提升效率走的正是这条“省钱又减热”的双赢路径。2. 三个点效率到底值多少钱从一块CPU算到整个机房讲道理容易看数字才有体感。这一节我从芯片级开始算一级一级放大到机房规模看看DC-DC效率从90%提到95%到底能省下多少电费和多少散热负载。2.1 单颗CPU的账以一颗600W处理器为例为了方便计算假设一颗CPU满载功耗600W供电电压1V左右。采用两种不同效率的VRM方案A方案效率90%B方案效率95%。输入功率的计算公式是P_in P_out / η。A方案90%600 / 0.9 666.7W损耗66.7WB方案95%600 / 0.95 631.6W损耗31.6W单颗CPU节省的电和热都是35.1W。一台双路服务器两颗CPU就是70.2W。再加上内存、存储、网卡这些辅助供电的DC-DC如果都从90%提升到95%整台服务器省下80~100W是很现实的事情。可能有人觉得单台省100W不算多但请注意这100W不只是少交了电费它还意味着机柜后部少排出100W的热量。在一个高密度算力集群里这个数字放大之后非常可观。2.2 一个机柜的账功率密度越高越敏感现代AI训练集群的机柜功率密度已经从传统的5~8kW一路飙升到30kW、50kW甚至更高。一个50kW的机柜如果VRM效率从90%提升到95%按5%的转换损耗节约来粗算50kW × 5% 2.5kW也就是每个机柜可以少产生2.5kW的热量。一个拥有500个这样机柜的数据中心IT端总功耗是25MW节省的转换损耗就是1.25MW。这1.25MW不需要从电网买不需要经过UPS不需要经过PDU更不需要被空调搬走。一句话变压器、开关、电缆、冷却塔的容量压力都同步变小了。2.3 一个机房的账把PUE和电费单放进来光省IT端功耗还不够要把散热系统的连锁反应也算进去。我们用一个容易理解的方法数据中心总用电 IT用电 供电损耗 散热损耗。假设某机房PUE是1.3IT端负载20MW总用电26MW其中6MW是基础设施损耗。散热系统大概占了基础设施损耗的60%左右也就是3.6MW。这3.6MW要搬走的热量正好约等于IT设备产生的热量因为供电损耗也产热但为了简化我们先按IT发热来对等分析。现在IT端因为DC-DC效率提升省了1MW的功耗机房里少产生1MW的热量。按照散热系统与热负载近似线性的关系散热耗电可以减少约0.3~0.5MW具体取决于冷却方式风冷比例高节省多液冷比例高节省少。总节省大约1.3~1.5MW。一年算下来按8760小时平均电价0.6元/度约合0.08美元1.4MW × 8760小时 × 0.6元/度 ≈ 736万元/年这就不是小数目了。而且这还只是电价直接节省还没算上碳排放配额、变压器容量费、备用柴油发电机的油料储备这些隐性成本。所以我一直觉得某些项目里为了追零点零几的PUE去改造冷站投入几百万效果还不稳定反而是先把服务器内部的电源转换效率做上去从源头减热成本更低、见效更直接。为了让计算更清晰我把上面几个层级的账汇总成一张表层级场景效率差节省功耗对应散热减量单颗CPU600W负载90%→95%35.1W35.1W单台双路服务器1300W负载90%→95%约80~100W80~100W单个50kW机柜满负载90%→95%2.5kW2.5kW500个机柜机房25MW IT负载90%→95%1.25MW1.25MW另带动散热节省3. 散热端的连锁反应为什么省1W电比想象中省得更多上面那张表里写的散热减量很多人以为自己已经明白了但我要说一个经常被忽略的点DC-DC效率提升带来的省电在制冷端会产生“二次节省”这部分收益比单纯的电费节省更能解释为什么行业会专门盯着DC-DC调节器做文章。3.1 冷负荷减少之后制冷系统怎么响应数据中心制冷系统一般由冷机、冷却塔、水泵、空调末端风机或冷冻水盘管组成。当机房里的热负载减少时整套系统可以根据控制策略降低输出冷机可以降载或休眠水泵可以变频降速空调风机转速可以调低。这里有个经典的风机节能公式风机功耗与转速的三次方成正比。转速降到原来的80%功耗降到原来的51.2%转速降到60%功耗降到21.6%。这意味着冷负荷只要下降一点点风机和水泵节约的电量会以超线性比例放大。举个例子原来空调末端风机需要用10kW把热风抽走机房里热负载降低5%之后风机转速可能只需要原来的90%对应的功耗变成10kW × 0.9³ 7.29kW。少了2.7kW降幅27%。当然这是理想化的三次方曲线实际变频控制还有最低转速限制和效率拐点不可能无限放大这个收益但量级逻辑是没错的。此外冷冻水温度控制也受益。热负载减少意味着冷冻水回水温度会降低冷机的压缩比可以调小能效比COP随之上升。冷机的COP每提升0.5对整个机房的用电影响都是非常可观的。3.2 还可以让服务器跑得更“热”这才是更大的省我把这个放在后面说是因为很多人没想到。DC-DC效率提升之后服务器内部元器件周围的热量减少芯片和主板的热环境会变得更友好。这意味着你可以在不违反服务器进风口温度规范的前提下适当调高机房的温度设定点。行业里一般讲“温度每提高1℃制冷能耗降低3%~5%”。如果因为电源转换损耗降低使得机房平均进风温度可以从22℃提高到25℃单是这3℃的温差就能省下约10%~15%的制冷能耗。在总电费里制冷能耗通常占20%~30%折算下来等于整体电费下降2~4个百分点。很多人问过我一个问题与其费劲换DC-DC为什么不直接调高空调温度答案是进风温度上限由服务器内部最热器件的温度决定。如果DC-DC和CPU的热量已经大幅下降服务器内部温度余量就大了你当然可以放心把机房温度调上去但如果电源转换损耗大内部局部热点严重机房温度一高可能就直接触发风扇全速运转风扇功耗暴涨甚至影响硬件寿命。所以DC-DC效率是温度冗余的基础它在帮你“解锁”空调温度上调空间。3.3 散热系统容量规划也跟着轻松再往深一层说散热成本不光是运行电费还包括初始投资和备用容量。设计一个30MW的机房如果DC-DC效率普遍偏低实际热负载可能比理论计算高5%冷机和冷却塔的选型就要放大5%变配电容量也要放大。这部分初始投资摊到设备折旧里每千瓦IT容量的建设成本会显著上升。反过来当供电链路效率提高单位算力对应的热负载下降你甚至可以在同样一套制冷系统下多塞进去一些算力设备。这就是为什么很多超大规模数据中心在选型时会把DC-DC调节器的效率验证纳入服务器白名单测试不是因为省那几度电而是因为涉及整个园区的容量规划。4. 效率高达97%的DC-DC调节器为什么不能无脑替换看到这里肯定有朋友已经准备去找高效率DC-DC方案了。但我要先泼一盆冷水DC-DC调节器不像PSU那样是一个独立的盒子它和CPU供电架构、PCB布局、控制算法深度绑定单纯换器件是行不通的。下面这些坑是我在实际项目里见过的逐个列出来帮大家排雷。4.1 峰值效率和全负载段效率是两码事很多厂商宣传的“效率高达97%”往往是在某一特定负载点比如50%~60%负载测出来的。但服务器运行时的CPU负载是剧烈波动的一会儿空载一会儿满载一会儿又处于中间状态。真正决定功耗水平的是加权平均效率而不是峰值效率。我在实测中见过一个典型的例子某款VRM标称峰值效率96.8%但在10%负载下只有78%30%负载下89%。而服务器大多数时间跑在20%~40%负载区间这种情况下它实际比一个标称92%但全负载段都稳定在90%以上的方案更费电。所以选型时一定要向厂商要效率-负载曲线而不是只盯峰值数字。测试标准上可以参考一些行业机构给出的负载点权重比如按20%/50%/100%各占一定比例来算加权效率再结合自己的业务负载模型来判断。4.2 效率上去了瞬态响应是否还能扛住DC-DC的效率提升通常需要优化开关频率、电感选型、驱动时序。但效率和瞬态响应之间存在经典矛盾为了降低开关损耗有些人会把开关频率调低但开关频率一旦太低对负载突变的响应速度就会变慢输出电压波动范围会超过CPU允许的容差一般要求±3%以内有些严苛的甚至±1%。CPU负载从空闲到满载的瞬态只有几十微秒。如果VRM响应不够快电压跌出容差范围CPU为了保证稳定会自动降频算力缩水。这一来省下的电费可能还不抵算力损失带来的收入损失。所以高转换效率必须建立在可接受的瞬态响应之上这两者要放在一起测试而不是只看稳态效率。我习惯的做法是在做候选方案评估时用电流波形发生器模拟CPU的典型负载跳变抓取输出电压的跌落深度和恢复时间。那种效率标得特别高但瞬态恢复时间拉长到一两百微秒的方案直接排除不然后期在业务高峰期会吃大亏。4.3 热设计余量也要重新算DC-DC转换器自身效率提升自身发热减少这是好事。但要注意热设计余量不只是看“少发多少热”还要看“热量集中在哪里”。有些高效率方案通过把发热集中在更小的面积上来实现高功率密度表面上看总热量少了但局部热点温度可能反而更高。我在一次测试中遇到过某款模块效率比原方案高了3个百分点总发热量下降了20W但因为器件尺寸缩小了一半散热片覆盖面积不够模块表面温度反而比原来高了10℃。这就很麻烦因为主板周围还有其他器件局部高温会烤着DRAM和电容长期可靠性存疑。所以评估DC-DC方案时不要只看效率曲线还要做热仿真或者实际热成像测试确认整个电源区域的温度分布是否合理。尤其是高密度GPU服务器CPU/GPU供电区的布局非常紧凑发热更集中稍不注意就会造成局部热失控。4.4 成本账和替换周期高效率DC-DC方案的器件成本、电感成本、PCB层数和铜箔厚度要求通常都比普通方案高一些。对单台服务器来说可能增加几十到一两百元人民币的成本。这账能不能算得过来取决于服务器规模和电价。我做过一个测算模型一台服务器因为DC-DC效率提升整机功耗下降80W按一年运行8000小时、电价0.6元/度来算年省电费约384元。如果单台增加的硬件成本在150元以内回本周期不到半年如果达到300元回本周期就要接近一年。对三年折旧周期的服务器来说依然划算但需要根据采购规模和资金成本做一个完整的TCO评估。另外提醒一句更换DC-DC方案不仅仅是替换电源芯片的问题。多相控制器、DrMOS、电感、电容的选型匹配、环路补偿参数、甚至PCB的过孔数量都需要重新设计。这意味着主板从设计到验证的周期至少要拉长两三个月。如果你的产品迭代节奏很紧要在立项时就把这个周期预留出来。5. 落地路径和验证方法如何从规划走到真实收益前面讲了原理、算账、避坑最后聊一聊怎么落地。这一节的内容更偏执行层面包括部署策略、测试方法和验收指标都是我实际操作过且验证有效的思路。5.1 从测试平台开始先摸底再放量我建议不要一上来就大规模更换服务器电源方案而是分三步走。第一步在实验室搭一个模拟真实负载的测试环境。选用具备PMBus或I2C接口的服务器主板可以实时读取各路VRM的输入功率、输出功率、负载百分比和效率值。没有PMBus的话也可以用高精度功率分析仪在12V输入端和CPU供电端做隔离测量测量精度至少要达到0.1%。第二步做一组A/B对比测试。同一型号服务器两套不同VRM设计跑同一种业务负载比如AI训练、数据库、Web服务混合负载记录24小时的总功耗曲线、温度曲线和性能数据。这样得到的是“真实负载下的加权效率”比厂商给的曲线有说服力得多。第三步小批量部署到单一机房或单一机柜列运行至少一个月观察电表、PUE、进风温度和故障率。如果小批量验证数据与实验室一致再扩大到整个集群。这个做法虽然周期长一点但能避免因为设计缺陷大规模返工。5.2 用PMBus记录真实负载效率如果你已经在用支持PMBus的服务器恭喜你验证工作会简单很多。通过PMBus可以读取到每一相电流、输入电压、输出电压、占空比等参数再用P_out / P_in计算出每个负载点下的真实效率。我建议写一个简单的脚本每30秒采集一次数据连续采集一周最后按负载区间做加权统计。下面是一个Python伪代码示例展示了统计思路import time import statistics # 假设通过 pmbus.read_output_power 和 pmbus.read_input_power 获取数据 efficiency_samples [] load_samples [] recording_hours 24 * 7 for _ in range(int(recording_hours * 120)): # 每30秒采一次 p_out pmbus.read_output_power() p_in pmbus.read_input_power() if p_in 0: efficiency_samples.append(p_out / p_in) load_samples.append(p_out / pmbus.max_power) time.sleep(30) # 按负载区间统计平均效率 bins [(0, 0.1), (0.1, 0.3), (0.3, 0.6), (0.6, 1.0)] for lo, hi in bins: bucket [eff for eff, load in zip(efficiency_samples, load_samples) if lo load hi] if bucket: print(fLoad {lo:.0%}-{hi:.0%}: avg efficiency {statistics.mean(bucket):.3%})统计结果能让你清楚看到这台机器在真实业务下DC-DC调节器大部分时间跑在哪个负载区间效率有没有达到标称值。这个数据比任何宣传材料都管用。5.3 验收指标不要只看效率还要看整机功耗和温度最终验收不能只看VRM效率这个指标因为它是中间量不是最终收益。我一般会定三个验收指标整机功耗下降相同负载模型下新方案的整机输入功耗比旧方案低多少。这个数字直接对应电费。关键器件温升CPU供电区域、MOSFET表面、电感表面满载运行时的温升值不能超过设计规格。系统稳定性跑满负载时CPU电压波动在规格范围内无降频事件无超温告警。只有三个指标同时通过我才会签收这批服务器的电源方案。否则即使效率数字再好看只要稳定性或散热上有一项不过关最终在数据中心现场都会变成很难收拾的问题。5.4 存量机房怎么优化如果你面对的是已经采购完毕、不可能马上更换主板的存量服务器也不是完全没有优化空间。有几个把DC-DC调节器效率补回来的偏方虽然效果不如换硬件但聊胜于无。一是调整CPU功耗管理策略。把CPU的功耗限制功率封顶设置的更合理一些避免长时间运行在低效率的负载区间尽量让CPU负载落在VRM的较高效率点上。二是优化风扇调速策略。既然转换效率低发热量不可避免那可以把服务器风扇控制策略改为“温度模糊区”模式在允许的温度范围内尽量延迟升速减少风扇功耗和噪音。三是加强机房气流组织减少局部热点让空调末端可以更高效地工作。这些措施投入都不大但能从侧面缓解DC-DC效率不足带来的热量和电费问题。6. 更长远的账12V架构与整个供电链路的协同优化到了最后我想把视野再拉高一点。DC-DC调节器效率绝不是孤立的话题把它放到整个数据中心供电链路里看其实牵出了一个更大的结构性问题我们能不能少几次转换从一开始就减少损耗发生的环节6.1 转换次数少一次损耗就少一段传统的服务器供电链路是市电交流 → PSU整流成12V直流 → 主板VRM降到CPU电压。再往前一步数据中心还有一级UPS的AC-DC-AC转换以及PDU配电。每一级转换都有损耗虽然每一级的效率单独看都不低但乘起来之后整体效率就非常可观。举个直观例子假设PSU效率96%VRM效率92%中间还有线缆和连接器损耗约1%那么从交流输入到CPU核心的整体效率就是0.96 × 0.92 × 0.99 ≈ 87.4%。也就是说有将近12.6%的交流电在半路上变成了热。如果VRM效率从92%提到95%整体效率变成0.96 × 0.95 × 0.99 ≈ 90.3%损耗比例从12.6%降到9.7%相当于整机功耗下降3个百分点左右。这个幅度比单纯优化任何一环节都显著。6.2 行业正在推的48V和直接12V方案行业里已经有不少针对“减少转换级数”的探索。一种思路是把主板输入电压从12V提高到48V因为同样功率下电压越高电流越小线缆和PCB上的导通损耗就越低。48V到CPU电压之间用中间总线转换器IBC或直接降压方案配合更先进的GaN/SiC功率器件整体效率可以做得很漂亮。另一种思路是减少中间电压调节环节把PSU输出的12V直接连到更靠近负载的位置由负载点Point-of-Load的DC-DC调节器就地完成降压减少长距离传输损耗。这两种思路本质上都是在向同一个方向努力让电能在到达芯片之前少走弯路、少发热。在实际项目中我遇到过一些基于48V供电架构的GPU服务器整机功耗比同算力的12V传统架构低3%~5%而且因为电流小连接器温升明显下降。虽然初始采购成本高但综合电费和散热费用后TCO反而更优。6.3 把精力从“治热”挪到“少产热”最后说一点个人体会。我们做数据中心的人长期以来习惯了“热了就制冷”的思路冷机不够加冷机风量不够加风机机柜太热就降低部署密度。这些方法不是说错而是太被动——你没有改变发热源头只是在为发热善后。DC-DC调节器这一类的电源优化启发我们换一个思路如果能让发热源头少产热制冷系统跟着减载整个系统的能效就会上一个台阶。这背后其实是一个朴素的道理——算力本身产生热量的物理下限是无法突破的但系统在供电转换、散热搬移这些“辅助环节”上的浪费是有很大压缩空间的。我在实际项目中体会最深的一点是电源效率提升带来的收益不是线性的它会在配电和散热两个维度上同时放大。你省下1W的转换损耗配电端省大约0.1W的线损散热端可能再省0.3W的制冷电费加起来接近1.4W。这种乘数效应让看似不起眼的DC-DC调节器效率优化成了数据中心整体能效提升中被严重低估的杠杆。如果你正在做一个数据中心的能效改造项目或者规划新建机房的服务器选型我建议把板级DC-DC调节器的加权效率列入必测项不要只看整机功耗标称值。实测数据会告诉你这颗小小的电源调节器对散热成本的影响远超你的第一直觉。
返回列表