龙蜥社区智算联盟发布《智算集群基础设施运维通用技术要求》(附下载链接) 随着全国一体化算力网建设、算力互联互通行动计划的稳步推进2026 年“十五五”规划纲要对算力基础设施建设提出了更高的要求加快国家枢纽算力设施集群建设论证建设超大规模智算集群推动绿色电力与算力协同布局降低中小企业用算成本。然而在智算基础设施建设飞速发展、集群规模不断扩大的同时基础设施运维的痛点也日益突显。软硬件协同断层、跨产品运维壁垒、智能运维技术应用碎片化、面向 AI 智能体的算力支撑功能缺失等问题正成为制约产业高质量发展的关键瓶颈。为破解上述难题龙蜥社区智算联盟以社区为平台联合智算硬件设备商、集群软件厂商、软件集成商、科研院校单位深入研究智算集群基础设施运维体系。联盟通过分析具体应用场景结合实际运维痛点总结发布了《智算集群基础设施运维通用技术要求》以下简称“技术要求”。该技术要求的制定旨在打通智算软硬件、跨主体运维断点补齐 AI 智能体底层算力协同短板为支撑智算集群基础设施稳定运行提供运维体系架构、关键运维功能的标准化建议。技术要求首先提出了面向用户、端到端、可异构、可扩展的智算集群基础设施运维参考架构明确了四大设计原则分层解耦——运维能力按对象分层组件间松耦合可分可合可扩展——覆盖智算项目建设全场景与业务全流程云原生化——支持微服务化部署面向用户——按需提供场景化、可组装的运维解决方案。图/智算集群基础设施运维参考架构主要运维组件包括硬件管理提供计算、存储、网络硬件基础设施统一管理与运维功能。GPU 运维提供 GPU 关键算力资源的基础监控故障诊断、性能压测等增强运维功能。智算集群运维提供虚拟化、云原生智算集群软件底座平台运维管理功能。网络运维提供多层次、多平面的网络拓扑监控网络故障诊断、网络性能调优等增强运维功能。作业运维提供训推任务关联模型、算子、网络以及云原生工作负载监控数据的跨域整合从业务视角跨层联动软硬件基础设施实现端到端运维。该技术要求能为智算集群软硬件产品生产商、系统集成商在系统设计、产品制造、运维集成方面提供指导为第三方测评机构实施智算集群运维体系和功能的测试与评价提供参考。随着超大规模智算集群的建设加速和 AI 智能体技术的快速演进智算集群基础设施运维将面临更加复杂的挑战。龙蜥社区智算联盟将持续迭代技术要求在智能化运维、AI 智能体算力协同、绿色运维等方向深入探索推动智算运维生态的标准化与成熟化。《智算集群基础设施运维通用技术要求》下载链接https://openanolis.cn/assets/static/AI_Infra_OM_GTR.pdf—— 完 ——

本月热点