AI Infra 到底在拼什么?异构算力是主战场 本文整理自 AICon 深圳直播《AI Infra 拼什么》通过AI音视频转录总结工具Ai好记视频转文字整理以下为精炼整理后的会议笔记内容。当大家把注意力都放在模型效果上时真正支撑AI跑起来的推理基础设施反而成了最容易被忽略的瓶颈。这场直播请来了vLLM committer、华为软件工程师莫梓峰以及第四范式、深耕调度与集群管理的工程师杨守仁。围绕AI Infra的核心挑战展开从模型架构的复杂化、全模态演进、异构算力管理一路聊到Kubernetes的异构调度、RL与Agent带来的新压力以及开源生态的马太效应。AI Infra的核心挑战1、模型架构的复杂化与多样化莫梓峰指出当前AI Infra面临的首要挑战是模型架构的日益复杂和多样化。语言模型架构在持续演进最初做LLaMA无非是一个d_model加上LLM就搞定了后来模型一代比一代复杂到了新版本光是适配就做了大半年光是committer就写了好几个月。多模态也在向全模态演进。两年前刚开始做多模态时只有图片输入后来变成音频、视频、图片三种都能接收现在甚至变成接收所有模态、也能输出所有模态连机器人机械臂的action都能输出。全模态模型已经不只是一个AR模型而是AR加IT甚至接进各种辅助模型。整个模型的流水线都开始复杂化了而不只是架构复杂。2、异构算力管理的挑战杨守仁从调度与集群管理的角度阐述了另一层面的挑战。大陆国产算力的规模和行业发展非常快核心痛点就是异构算力的管理层。除了英伟达的卡客户可能还有寒武纪、昆仑芯、天数智芯、沐曦等各式各样的卡每家的特性都不一样。异构上遇到的最大挑战是一致性。算法这边的架构和实现是一方面可能在某个标准库里有标准的kernel但在国产的卡上kernel能不能保证大部分情况一致是个很大的问题。他举了个具体案例有家国产厂商在某个shader下输出就是错的只能靠offload到CPU的方式绕过。随着集群规模变大客户往往至少有两家不同厂商的卡算力管理更复杂业务类型也更多样。多模态推理的技术实践与架构演进1、全模态模型的工程实现以适配工作为例莫梓峰详细解析了全模态模型的技术挑战。它本身有三个部分AR部分、把AR文字输入转成code再转token、最后把这个token转换输出为音频。三个部分资源需求完全不同AR需要KV Cache其他部分需求完全不一样每个部分要单独调优但每个参数可能有不同的最优方案。设计框架时假设每一部分都要充分分离不能完全装成单一的流水线既能在注册的同时异步调度。当时的结论是还有20%的优化空间没打满Profile的时候还有一些Gap传输时会有Bubble要通信有些通讯部分还没优化好。2、框架架构的选择统一还是分离关于多模态框架应该整合到主框架还是独立维护莫梓峰分享了vLLM的实践经验。分离设计做起来挺顺接入某些模型时很舒服。但如果每个部分都单独一个仓库面对全模态模型就要四处开战适配问题拉得很长。不过分离也有维护成本。选择把某些部分剥离出来、只保留核心做AR之后每次后端更新版本接口都要跟着更新接口一直在变一次可能要动几千行代码来刷新。3、AI Agent对开源社区的挑战莫梓峰还分享了AI Agent给开源社区治理带来的经验。总体判断是利大于弊毕竟框架起草时也用了AI一小时完成单靠人写迭代速度会非常慢。最大的问题是代码质量。很多人提PRAgent写完以后自己不看description也是Agent写的一打开就是几十行几百行的描述代码也没写干净改完剩下的东西就留在那里。筛选中社区会通过留通信邮箱来识别活人用工作邮箱或学校邮箱发邮件的先看活人的。自己也会先提几个初始评论有人秒回、有人隔几分钟才回一眼是机器人的基本就pass或者有道理且没什么问题就顺手帮忙修了。还有个极端案例有机器人直接刷了40多条十来分钟刷那么多直接扣死。4、原生多模态架构的未来影响关于vLLM架构对多模态推理的影响莫梓峰认为这种模型对调度其实比较友好因为少了一块要调底层代码的部分直接一个线性层投过去就行没什么overhead。KV Cache管理的关键在attention实现普通的Transformer架构差别不大但如果对图片部分做双向注意力KV就会变得非常麻烦。Kubernetes异构调度与哈密项目1、K8s异构资源管理的演进杨守仁回顾了K8s异构调度的历史。最早在OpenStack做通用异构资源管理后来引入K8s当时非常想做带外out-of-band的方法类似RDMA方案带外的好处是对异构硬件或加速器的管理更自由很多地方不特别依赖in-tree的trait支持。后来是NVIDIA收购Mellanox后推动RDMA。关于DI2.0确实比之前简化了很多之前的API太复杂表达能力虽强但开发简单可用的东西成本太高。2、哈密项目的定位与发展杨守仁介绍了哈密项目的设计思路。一开始的定位是从GPU虚拟化显存或算力共享切入原来只能把单块卡分配哈密通过调度上的扩展机制用多个resource name完成对一个资源的描述更符合用户的实际体验。后来发展成实现了一套跟通信相关的单独协议要求所有组件遵循消息才能正常工作国产厂商也有主动接入的。与DI的关系上他们并没有脱离DI体系还是在DI体系下先把产品发展出来在DI到GA阶段之前就已经开始做DI driver。3、DI的表达能力与局限性杨守仁分析了当前DI方案的特点。表达能力确实有限高阶特性只能通过key-value描述。更高阶的一些动态的东西表现没那么好。比如有工程师想做到某个设备通过某种方式分发到虚拟机时不共享、否则就共享这种灵活能力在另一种实现里已经很好实现因为可以自定义设备的排他性状态但用DI还比较难做因为调度器不知道底层分配时的策略机制是否排他。还有一个恶性循环现在推的新特性很多但很多还在Alpha阶段大家不敢在生产上用反馈就少反馈少特性进入Beta、GA就慢越慢越没人敢用。异构计算的新趋势与RL、Agent的影响1、后训练与RL带来的异构需求莫梓峰从多模态角度分析了RL场景的异构特性。多模态LLM比纯文本的更麻烦要传多模态的evidence、传一堆token通讯量比传统LLM大很多。所以异步通信的需求非常大优化瓶颈的放大效应更严重而且大模型本身是multi-stage的还叠加异步。甚至出现GPU瓶颈在进程中间传东西被卡住GPU反而跑不满。所以有需求把Tensor处理好的图片直接塞进去、跳过某一步不然GPU进程引入的开销太严重。2、Agent对基础设施的新挑战杨守仁分享了Agent场景的实际观察。存储压力激增Agent产生的数据量特别大共享存储的读写压力一下就上去了。一台服务器能起的Agent数量有限每个Agent要占不少内存和运行时开销沙箱安全叠加上运行开销能不能支撑大规模使用是很大问题用量一上来就容易OOM。未来展望与开源生态1、2030年AI Infra的演进方向莫梓峰判断软件进一步简化的概率更高。杨守仁则大胆设想Infra这块可能会被AI接管。Infra的课题没那么复杂只是细节多模型学会后可能做得比人更好而且有很多其实是过度设计的点。人会从实现走向规划和设计去理解当前业务点。但监控还是要人自己定义有实践表明有同学交流过用AI接管某套系统一个晚上直接提升10倍。所以一个很大的点是监控自己搞但Infra的操作和实现可能模型能给出比人更好的方案。人需要定义的是更高阶的基础设施工程指标剩下的交给AI。2、开源与闭源的博弈及生态价值莫梓峰认为开源比闭源更有优势很多企业以前闭源但迭代速度太快自己闭门造车不如开源出去说不定还有人帮忙维护所以倒逼闭源的开源出来。杨守仁从商业模式角度分析开源的优势是中立厂商没有后顾之忧用户不担心被某一家厂商绑架贡献也不会因为另一家话语权更大而被剔除。这种商业模式能跑起来用的多就成了事实标准。开源项目的核心挑战是保证所有case都覆盖好、软件质量可信、长期愿景达成共识。拔高一点说就是怎么让大家有共识相信这个社区开放且运作良好deliver的软件质量让人信任长期愿景是大家认可的共识。3、开源工具的马太效应杨守仁提出一个很深刻的观点。开源项目还有个好处是模型训练能拿到这些数据像某些社区很多PR的流程都在训练流程里模型很清楚review的风格对开源模型的亲和性非常好。未来工具会收敛。用的人更多的工具在后训练阶段一定会被强化小众工具慢慢就没人用模型对小众工具的调用越来越难特别是API不符合直觉、泛化不出能力的时候。直觉是一种泛化的感觉。越好的项目越容易集中模型把项目作为重要参考强化它就成了脚手架。今天在某个框架上做简单适配模型很快能发现去哪改改出来更符合原作者的品位更容易回馈社区。迭代是明显的正向循环和自我强化说得直接些就是马太效应。技术问答与最佳实践1、AI Infra的定义莫梓峰认为要支持整个AI智能体能跑起来的所有部分都能归入AI Infra广义上缺一不可就像建房子打地基到K8s、集群调度、各种算力、算子都算一环。杨守仁则认为是承载workload所需要用到的以下所有组件加上所用硬件合在一起。2、硬件算子不支持的应对策略杨守仁分享了应对经验。第一优先找厂商问新版本有没有做这事。真的不支持的话如果是在输出层比较靠后的层可以直接offload到CPU跑如果在中间层要频繁来回切那就没办法。开源项目可以自己手写算子现在模型能力很强其实挺好写可以让模型不停在loop里试只要愿意烧Token总能优化到不错的效果。最难的点在于改完之后验证效果先不说性能先说一致性即正确性这个非常费劲。有时发现问题也是偶发的、在某个特定后端场景下出错非常难复现。莫梓峰补充很多开源项目有硬件厂商驻扎像华为里有committer和工程师。3、Corner Case测试的最佳实践莫梓峰分享了测试覆盖的经验。出问题只能加超时去补想抓corner case很难复现除非发现精度丢失。可以让整个AI跑几十次去扫用不同的concurrency组合扫一遍看什么情况下出问题。就像之前做GPU相关的democoncurrency开到16以后才开始报OOM或非法内存访问只能用那种方法慢慢扫。常见问题FAQQAI Infra当前最大的挑战是什么模型架构日益复杂多样、全模态演进、异构算力一致性、KV Cache管理与attention实现以及Agent带来的存储和运行时开销压力。Q异构算力的核心痛点是什么一致性。国产各家卡的kernel不一定能保证大部分情况一致有时特定场景下输出就是错的只能靠offload到CPU等方式绕过。Q多模态全模态模型为什么难做通常分多个阶段如AR、文本转token、token转输出各阶段资源需求不同、要单独调优、异步调度通信Bubble还有约20%优化空间没打满。QK8s异构调度怎么演进从OpenStack时代的通用资源管理到K8s的带外RDMA方案再到哈密项目的GPU虚拟化切入通过调度扩展机制和多resource name描述资源。Q为什么开源工具会形成马太效应用的人多的工具会在模型后训练阶段被强化模型更擅长调用它迭代更快、更符合作者品位、更容易回馈社区形成自我强化的正向循环。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转图文笔记的AI知识库工具支持B站、小红书、抖音、小宇宙等平台链接及本地音视频文件解析视频转文字后自动生成精华速览、思维导图和结构化图文笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。