
AI 会带来气候收益但它可能同时把化石燃料的“续命时间”拉得更长。这是最近关于 AI 环境影响的讨论里最值得技术人关注的一个判断模型能力上去了数据中心耗电上去了AI 又被油气行业拿去做勘探和钻井优化。两件事叠在一起净效果很可能不是减排而是增排。这篇文章不站在道德角度评判只做技术拆解AI 的能耗账单到底有多大AI 为什么会被化石燃料行业使用气候收益为什么会被抵消以及如果我们继续做 AI 工程有没有办法让模型在同等效果下少耗电、可测量、可优化。如果你正在做模型训练、推理服务、本地部署或数据中心规划这篇文章的核心内容可以直接对应到你的工程决策里。1. 核心观点速览维度内容核心矛盾AI 能优化能源系统、加速材料发现但自身高能耗 被化石燃料行业大规模采用可能抵消气候收益主要耗能环节大模型训练、推理服务、数据中心散热、芯片制造化石燃料行业如何使用 AI油气勘探、钻井参数优化、炼化调度、供应链管理AI 正面气候用途气象预测、电网调度、电池材料发现、碳封存选址、能效优化抵消机制回弹效应、算力竞赛、效率提升被新增需求吃光工程侧可做的事情量化、蒸馏、剪枝、低精度推理、绿色调度、碳足迹追踪核心工具CodeCarbon、nvidia-smi、云厂商碳强度 API、MLPerf 功耗基准合规重点AI 用于资源开采、能源调度、供应链等场景需遵守数据和环保合规要求给读者的建议先建立“一次推理耗多少电”的量化意识再谈减排2. 先看现实AI 的能耗账单来自哪里讨论 AI 的气候影响不能停留在“训练一个大模型很费电”这种模糊说法。能耗分布是分层的。第一层是训练阶段。大规模语言模型和扩散模型的训练需要在成千上万张 GPU 上跑数周到数月。每一张高算力 GPU 的整机功耗在几百瓦级别一台 8 卡服务器满载时功耗接近一台重型空调机组。训练集群不是一台服务器在跑而是几百上千台同时跑还有配套的存储、网络、CPU 节点和散热系统。第二层是推理阶段。很多人以为训练结束就不耗电了实际上推理服务的总能耗会随着用户量上升而快速超过训练。每个请求都要过一遍完整的前向计算。大模型上线之后用户越多、上下文越长、生成 token 越多单次请求的算力消耗就越大。推理服务为了降低延迟往往不会把 GPU 塞满这种“低利用率 高基数”的模式会让电力浪费更明显。第三层是数据中心基础设施。GPU 工作时产生大量热量数据中心需要空调、冷水机组或液冷系统把温度压住。制冷本身可以占数据中心总能耗的 30% 到 40%。再叠加供配电损耗最终体现在电费账单上的数值往往比 GPU 标称功耗高出一截。第四层是芯片制造。先进制程芯片的生产本身就是高耗能、高耗水过程。这个部分虽然不在模型运行现场但属于 AI 产业链的间接排放。如果只想记住一个结论AI 的能耗不是单点问题而是“算力硬件 模型规模 服务规模 基础设施”的乘数问题。任何单点优化都会被其他环节放大或抵消。3. AI 如何进入化石燃料产业链AI 被化石燃料行业使用并不是“未来可能发生”而是已经在多个环节落地。油气勘探是最典型的场景。传统勘探依赖地质学家人工分析地震数据周期长、成本高、成功率有限。深度学习模型可以在地震切片中识别地下构造自动标注可能的油气藏位置。模型跑得越多勘探人员就能在更短时间内筛选更多区块。效率是真实提升但结果是把更多原本不具备经济性的油气储量变成了可开采资源。钻井优化是第二个场景。钻井过程中有大量实时参数钻压、转速、泥浆性能、地层压力。过去靠工程师经验判断现在可以用强化学习和时间序列模型实时推荐最优参数减少卡钻、井漏事故缩短钻井周期。单口井的成本下降、成功率提高直接结果就是更多钻井被排上日程。炼化和供应链调度是第三个场景。炼油厂需要根据原油价格、产品需求、设备状态做生产计划。AI 优化器可以分钟级输出排产方案降低能耗和原料损耗。这种优化让炼化环节的单位排放下降但也会让整体产能维持在更高水平。从企业角度看这些都是合法且理性的商业决策AI 降低了发现和生产化石燃料的成本提高了资产回报率。但从气候角度看AI 在这里扮演的角色是“提升化石燃料供给效率”而不是“降低化石燃料消费”。新闻标题说“AI 的潜在气候效益被它在推动化石燃料中的作用所抵消”指的就是这层逻辑。技术人需要注意的是我们开发出来的通用能力比如时序预测、强化学习、大模型推理并不天然指向清洁用途。同样的模型架构可以用来做电网负荷预测也可以用来做油田产量预测。部署场景的选择决定了最终的气候效应。4. AI 的正面气候贡献仍然真实存在先说清楚AI 在气候领域确实有不少正面应用不是“全无用处”。气象预测是最成熟的方向之一。传统数值天气预报需要超级计算机跑几小时深度学习方法可以在更短时间内给出可比的预测结果。更精准的极端天气预警能减少灾害损失也能帮助风电场、光伏电站安排发电计划。电网调度是另一个高价值场景。风电和光伏发电具有波动性AI 可以基于历史数据和实时天气预测发电量优化储能充放电策略降低弃风弃光率。这类应用不产生新的能源但能提高清洁能源在电力结构中的占比。材料发现和碳封存也是重要方向。锂电池电解质、催化剂、碳捕集材料都涉及巨大的化学空间AI 高通量筛选可以缩小实验范围把新材料研发周期从十年级缩短到年级。碳封存选址需要分析地质结构和压力场AI 可以辅助建模降低封存项目的风险。如果只看这些案例AI 确实能帮助减排。但这些正面应用的共同特点是它们优化的是“过程的效率”而效率提升不一定能抵消系统规模的膨胀。这就是下一节要展开的问题。5. 为什么潜在收益可能被抵消5.1 回弹效应经济学里有个概念叫回弹效应技术进步让某个行为更高效人们反而会增加这个行为的规模最终总消耗可能不降反升。放到 AI 上模型推理变得更便宜、更快于是应用方会在更多场景里使用 AI。原来的能源优化模型只用在新风电场现在因为部署成本低了传统火电厂的运行优化也上了 AI。单位优化效果确实存在但优化对象的基数扩大了总排放反而可能上升。5.2 算力竞赛这是最直接的抵消机制。当前大模型领域的竞争逻辑是“更大、更长、更多模态”。每一代模型的参数量和训练数据都在增长训练能耗随规模超线性上升。单模型能效提升的速度很难跟上算力总规模扩张的速度。这种竞赛不只在少数公司发生。开源社区也在持续训练更大模型企业与高校各自部署训练集群。全球 AI 算力总需求的年增速远高于单芯片能效的年改善幅度。5.3 效率不等于减排模型量化之后同样的推理任务功耗可能下降一半。很多人会直接把它等同于“减排”。实际不是。效率提升会降低单次调用成本调用量增加后总能耗可能回到原样。要真正让 AI 对气候产生净正面影响至少需要三个条件同时成立AI 服务的总规模增长速度受控、被优化对象本身向清洁方向转型、AI 能力不被用于放大高排放产业。从目前信息看这三个条件没有完全成立。6. 工程侧降低 AI 自身能耗的四个方向作为工程师我们很难直接左右油气公司是否使用 AI但可以控制自己负责的模型和服务消耗多少能源。这部分是确定能做的。6.1 模型压缩量化、蒸馏、剪枝量化是目前收益最明显的工程手段。把模型权重从 FP16 降到 INT8 或 INT4显存占用下降推理吞吐提升单位请求功耗下降。对多数生产场景INT8 量化结合少量校准数据质量损失可以控制在很小区间。蒸馏是用小模型学习大模型的输出分布训练完成后只部署小模型。蒸馏后的 7B 模型可以在部分任务上接近原版 13B 模型的效果推理成本却低一截。剪枝适合已经训练好的模型。把冗余注意力头或网络层去掉再微调恢复精度。剪枝的收益不如量化稳定但和大模型蒸馏结合使用效果不错。6.2 低精度推理与批处理推理阶段尽量使用低精度。GPU 推理时FP8 和 INT8 能有效提升计算密度。同时注意 batch size小 batch 延迟低但 GPU 利用率低大 batch 吞吐高、单 token 能耗低。离线批量任务应该优先用大 batch在线交互服务再根据延迟要求调整。6.3 绿色调度错峰和跨区域调度电力碳排放强度随时间变化。夜间风电出力高、白天光伏出力高不同地区电网的碳强度差异很大。如果任务不要求实时响应可以推迟到低碳时段执行。云厂商通常会提供电网碳强度数据或碳排放 API本地数据中心也可以接入区域电网的实时碳强度接口把训练任务调度到碳强度较低的时段。6.4 数据中心散热与硬件选型新建或扩容算力时优先考虑能效更高的硬件和散热方案。液冷比风冷在功率密度高时更节能温水冷却还能回收热量。这属于基础设施决策但对长期电费影响很大。7. 如何测量 AI 的碳足迹没有测量就没有优化。建议从三个层面积累数据单次推理能耗、单次训练任务能耗、月度总量。7.1 用 nvidia-smi 记录 GPU 功耗最基础的能耗记录方式是轮询 GPU 功耗并累加。下面脚本可以在训练或推理过程中验证单张显卡的功耗曲线import subprocess import time import csv def read_gpu_power_mw(): output subprocess.check_output( [nvidia-smi, --query-gpupower.draw, --formatcsv,noheader,nounits] ).decode().strip() return [float(x) for x in output.split(\n)] with open(gpu_power.csv, w, newline) as f: writer csv.writer(f) writer.writerow([timestamp, gpu0_watt, gpu1_watt]) try: while True: powers read_gpu_power_mw() writer.writerow([time.time()] powers) time.sleep(5) except KeyboardInterrupt: pass这个脚本只能看到 GPU 本身看不到 CPU、内存、制冷的耗电。要估算整机功耗可以乘以 1.3 到 1.5 的经验系数但以实际测量为准。7.2 用 CodeCarbon 自动追踪训练碳排放CodeCarbon 是目前使用较广的开源库可以监测训练过程的 GPU/CPU 功耗并结合所在地区的电网碳强度换算成二氧化碳排放量。pip install codecarbon训练代码里只需要加几行from codecarbon import EmissionsTracker tracker EmissionsTracker(project_namemy_finetune) tracker.start() # 模型训练代码 model.train() emissions tracker.stop() print(ftraining emissions: {emissions} kg CO2eq)CodeCarbon 需要联网获取地区电网碳强度数据如果训练环境断网可以改用离线模式或手动指定碳因子。项目文档里有具体参数按实际环境调整即可。7.3 训练全周期的能耗估算公式更粗略的估算方式是训练总能耗(kWh) 训练时长(小时) × 平均总功耗(kW) 训练碳排放(kg CO2eq) 训练总能耗(kWh) × 电网碳足迹(kg CO2eq/kWh)其中“平均总功耗”需要覆盖服务器整机、网络设备和制冷。取数时最好用数据中心级电表读数而不是只看 GPU 功耗。8. 数据中心与本地部署的能效优化实践无论你用的是云上 GPU还是本地服务器都有可以落地的优化项。8.1 关注 PUE 和空间碳因子数据中心行业用 PUE 衡量能效PUE 数据中心总能耗 / IT 设备能耗。PUE 越接近 1说明制冷和供电损耗越小。选择云服务商时可以优先看对方是否公布 PUE、是否采购绿电、是否有区域碳强度数据。本地部署 AI 模型时如果只追求“跑通”容易忽略散热设计。机柜摆放在通风好的区域、空调温度设置在合理范围、闲置 GPU 主动休眠这些都能省下可观的电费。8.2 把训练任务调度到低碳时段如果训练任务没有硬性交付时间可以做一个最简单的“碳强度门控”脚本# 假设已经从一个碳强度 API 获取当前值 carbon_intensity$(curl -s https://api.example.com/carbon-intensity/current) threshold200 if (( carbon_intensity threshold )); then echo carbon intensity is low, start training nohup python train.py train.log 21 else echo carbon intensity is high, wait fi这个脚本只是示意实际使用时需要替换为具体的数据源和阈值逻辑。生产环境建议用队列系统加调度策略而不是 shell 脚本硬等。8.3 按场景拆分推理路径同一份模型部署不同请求对延迟的要求差别很大。实时对话要求首 token 低延迟日志分析、批量审核则完全不要求实时。把两类请求拆到不同部署实例离线实例可以用更大的 batch、更低的精度、更高的 GPU 利用率。9. 关于 AI 气候影响评估的几个现实问题9.1 数据不一致会误导判断不同研究对“AI 训练一次消耗多少电”的估算差异极大。差异主要来自硬件配置、训练时长、数据中心 PUE 的假设不同。看到一张“某大模型训练排放图表”时先确认它的计算口径再决定是否引用。9.2 模型能力增长与能耗增长不是线性关系更常见的规律是模型质量进入平台期后继续提升一个点需要翻倍甚至翻几倍的算力。这种边际收益递减意味着算力投入会越来越大但用户感知的提升越来越有限。这对气候是不利的。9.3 开源模型的部署地点分散开源模型发布后会被部署到全球各地。同一个模型在绿电充足地区运行碳足迹接近零在煤电为主地区运行碳足迹高出一个数量级。模型本身不能决定碳排放部署地的电力结构才决定最终碳足迹。10. 本地部署 AI 模型的性能观察要点很多读者关心本地部署 AI。抛开气候因素单从工程角度本地部署至少要观察几个指标GPU 利用率、显存占用、功耗、温度、吞吐量。启动推理服务后可以用 nvidia-smi 持续观察nvidia-smi --query-gpuutilization.gpu,power.draw,temperature.gpu,memory.used --formatcsv -l 1输出示例格式如下utilization.gpu [%], power.draw [W], temperature.gpu [°C], memory.used [MiB] 95 %, 287 W, 68 °C, 8123 MiB如果 GPU 利用率一直很低但功耗不低说明模型推理没有充分利用算力可能是 batch size 太小或存在 CPU 瓶颈。如果显存占用接近上限但利用率不高则可能需要优化 KV Cache 或改用更小的上下文长度。本地部署的一个隐藏成本是闲置功耗。即使没有请求模型常驻显存也会维持一定功耗。如果业务有波峰波谷建议在低峰期卸载模型或缩容实例。11. 常见问题与排查方法问题现象可能原因排查方式解决方案模型量化后效果下降明显校准数据不充分或精度选择过激进对比量化前后验证集分数换校准集、改用 INT8 混合精度GPU 功耗高但利用率低数据加载瓶颈、batch size 太小观察 CPU 和磁盘 IO加大 batch、预加载数据CodeCarbon 无法联网网络隔离环境查看报错信息改用离线模式或手动指定碳因子推理服务功耗比预期高空闲时模型未卸载监控请求数和 GPU 功耗曲线增加自动缩容或模型卸载策略训练任务总在碳强度高峰执行无调度策略记录任务开始时间接入碳强度 API 错峰调度数据中心温度过高制冷不足或机柜布局问题检查 PUE 和热点分布调整气流组织、考虑液冷12. 最佳实践与合规边界想把“AI 节能减排”真正落地建议在团队里建立这么几条规则。第一每个上线模型都要有能耗基线。记录一次训练的总耗电、一次推理的平均功耗、部署后的月度总功耗。没有基线之前任何“节能优化”都无法量化验证。第二模型压缩要作为默认步骤而不是可选项。对生产推理模型先量化再上线效果不达标再回退并记录原因。蒸馏和剪枝则需要结合评测集判断。第三批量任务必须做好任务画像。同一批任务里有些是实时交互有些是离线处理。离线部分统一走低碳调度节省成本的同时降低碳排放。第四涉及 AI 在能源、资源、供应链等领域的使用时需要关注对应的合规要求。比如 AI 用于油气勘探、矿业分析、能源交易预测要遵守数据处理、数据安全和行业监管规则。不能因为“模型效果更好”就忽略数据来源和用途合法性。第五对外宣传减排效果时要谨慎。一家公司同时做“AI 优化电网调度”和“AI 提升油田产量”就不能只讲前者的减排故事。这个道理对机构和媒体同样适用。13. 总结与下一步回到文章标题AI 的潜在气候效益确实可能被它在推动化石燃料方面的作用所抵消。判断这个命题是否成立不能只靠几篇报告而是要回到工程数据模型训练用了多少电、部署在什么电网、被什么行业调用、优化对象是否属于高排放产业。建议你先从自己最可控的部分开始验证用 nvidia-smi 或 CodeCarbon 记录一次推理训练任务的能耗尝试对模型做 INT8 量化对比量化前后的功耗和质量差异。数据积累起来之后再谈你的 AI 系统到底是在帮助减排还是在扩大排放。下一步可以继续深入的方向包括绿色算力调度平台、数据中心余热回收方案、低精度训练、模型碳足迹标准化评估。先把测量体系建起来这是所有优化决策的基础。