数据表征到数据流编排的存算协同优化:从模型压缩到推理加速 本文整理自 AICon 上海2026《李皓民 - 数据表征到数据流编排的存算协同优化》通过AI音视频转录总结工具Ai好记进行视频转文字整理以下为精炼整理后的内容。大模型推理的三大矛盾存不下、算不快、用不满AI 模型的计算需求以每年约 4.7 倍的速度增长而硬件算力增速仅为每年约 1.5 倍存储带宽的增长更加缓慢。这个供需鸿沟带来了三个核心问题存不下模型规模指数级上升DRAM 带宽增长跟不上推理吞吐需求。以万亿参数模型为例仅参数存储就需要数百 GB 显存。算不快即便有足够显存单次推理的延迟仍然难以满足实时性要求。用不满即使在先进的 GPU 集群上硬件的实际利用率也远未饱和大规模的稀疏计算未充分利用硬件能力。现有模型压缩技术的局限主流的模型轻量化方法包括剪枝、量化、知识蒸馏和低秩分解。每种方法都有其适用场景但也面临共同的矛盾粒度与硬件利用的冲突粗粒度压缩硬件友好但压缩比有限细粒度压缩压缩比高但硬件不友好。这个矛盾贯穿整个模型压缩领域。三层分解研究框架李皓民团队提出了从三个空间协同优化的研究视野算法空间剪枝、量化、注意力优化系统/编译层算子访存与并行度优化架构空间注意力机制、稀疏计算、混合精度计算点一形态之检——解决存不下动态跳层推理核心洞察是大模型的层间存在严重的信息冗余。Qwen 和 LLaMA 的层相似性实验表明了这一点。传统跳层方法的局限在于难以平衡跳过率与精度且缺乏精度补偿机制。动态跳层方案引入了两个关键创新决策网络根据输入内容动态决定跳过哪些层认知令牌注入通过额外 token 补偿被跳过层的信息损失知识蒸馏辅助训练用教师模型指导学生模型的跳层决策实验结果表明在同等的加速比下动态跳层方法的性能明显优于静态方案。难易度感知的自适应精度推理针对量化精度问题团队发现不同推理阶段的量化策略应该不同Prefilling PhaseW8A8 与 W4A8 收益最佳Decoding Phase小 batch 用 W4A16大 batch 用 W4A8进一步的观察发现模型的置信度会随生成长度上升而提升即模型对早期生成的内容容忍误差的能力更强。基于此团队设计了一套动态调度方案离线生成多种量化配置的模型副本在线推理时持续监测模型困惑度困惑度超过阈值时动态将低精度层替换为更高精度版本点二时间之准——解决算不快语义感知的投机解码传统投机解码依赖小型 Draft 模型但小模型在复杂语义场景下的预测准确率有限。语义感知的投机解码通过引入语义理解能力显著提升了验证效率。MoE 模型的预取优化MoE混合专家模型的专家路由机制带来了特殊的优化机会。核心洞察是专家权重存在空间不均衡性和时间局部性——相邻的 token 倾向于使用相同的专家。基于此团队提出了双熵编码将专家权重分解为基部分和增量部分实现紧凑存储与选择性加载模式复用利用查找表复用高频的 Base-Delta 映射对动态预取窗口根据历史命中率自适应调整预取的专家数量点三协同之效——解决用不满在编译优化层面团队通过削峰填谷策略在时间维度上拆分计算降低单次推理的内存峰值有效提升了资源利用率。此外以查代算的思想贯穿整个设计——在 KV Cache 压缩中采用乘积量化PQ将 KV 矩阵分解聚类用查表操作替代直接计算。在硬件层面将 PQ 方法与存内计算硬件结合进一步缓解近存计算瓶颈。实际部署效果这套存算协同优化方案已在蚂蚁集团、华为等实际业务场景中部署落地40% 推理加速通过动态跳层和自适应量化实现60% 吞吐提升通过 MoE 预取优化和编译优化实现显著降低显存占用通过细粒度模型压缩设计原则总结团队总结的核心原则是以最小的软硬件代价、最简单的控制逻辑实现对稀疏范式的最佳利用。大模型优化如果过度追求某个单一维度的极致往往会牺牲系统整体的效率和实用性。算法、系统、硬件的协同设计才是走向高效大模型推理的正确路径。以上内容由Ai好记进行转录整理。Ai好记是一款音视频转图文笔记的AI音视频总结助手支持解析B站、抖音、小宇宙等平台链接及本地、网盘的音视频文件转录后自动生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

本月热点