ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

华为FusionSphere数据中心虚拟化部署实战:HA、热迁移与存储扩容避坑指南

华为FusionSphere数据中心虚拟化部署实战:HA、热迁移与存储扩容避坑指南 简介这份华为数据中心虚拟化解决方案文档面向企业IT架构师、运维工程师及云计算学习者围绕FusionSphere虚拟化技术系统讲解如何整合计算、存储与网络资源构建高可靠、可自动化运维的云数据中心。内容涵盖FusionCompute与FusionManager两大组件、集群资源池、HA高可用、虚拟机与存储热迁移、HyperDP快照备份以及接入控制、虚拟化资源池、存储资源池等典型架构模块并给出单数据中心方案拓扑与平滑扩容思路。资源包共1个docx文件约355KB结构完整、便于查阅适合作为项目技术建议书或方案设计参考。目前已有230人学习下载。读者可借此理解华为虚拟化平台的部署逻辑、可靠性保障机制与资源调度方式为数据中心改造或数字化转型方案撰写提供直接借鉴。1. 华为 FusionSphere 数据中心虚拟化一份方案文档能落地出什么很多做 IT 基础设施的同行拿到一份《华为数据中心虚拟化解决方案.docx》第一反应是这不就是厂商售前模板吗。我一开始也这么想直到有个客户现场要求把方案里的 FusionSphere 架构真正拆成可执行的部署步骤才发现这份文档的价值不在文字本身而在于它把计算资源池、HA 调度、存储热迁移、HyperDP 备份这几条线串成了一个完整的数据中心改造路径。它解决的核心问题是把一堆散落的物理服务器通过虚拟化整合成统一资源池让业务在单台设备故障时自动漂移同时把运维从一台台登机器变成一个 Portal 管全部。适合谁看正在做数据中心虚拟化选型、需要给客户出技术建议书、或者准备把现有物理架构迁移到 FusionSphere 的工程师。下面我按文档讲了什么 → 怎么照着搭 → 哪里容易翻车的顺序拆一遍。2. FusionSphere 两大部件拆解FusionCompute 与 FusionManager 各管什么2.1 从物理集群到逻辑集群的层级关系方案文档里最容易看漏的是层级关系。一套 FusionSphere 云平台由 FusionCompute 和 FusionManager 两大部件组成但它们的管辖范围完全不同。FusionCompute 是虚拟化基础引擎负责服务器、存储、网络的虚拟化每套 FusionCompute 由一对主备管理节点 VRM 组成一对 VRM 管理一个物理集群。FusionManager 则是云管理入口一套部署一对主备节点通过自动发现功能识别其管辖下的物理设备资源和组网关系可以管理多个物理集群。关键点在物理集群和逻辑集群的区分。一个物理集群中可以把多台服务器划分成多个逻辑集群逻辑集群又叫 HA 资源池一个计算资源池有相同的调度策略。要使用热迁移相关的调度策略资源池内主机的 CPU 必须同制。计算资源池不包括网络资源与存储资源这两块是独立管理的。我见过有人把不同代次的服务器塞进同一个逻辑集群结果热迁移直接报 CPU 不兼容这就是没理解同制的硬约束。2.2 统一硬件管理 UHM 的实际作用FusionManager 里包含一个统一硬件管理组件 UHM提供硬件自动发现、自动配置、统一监控带内和带外、硬件统一告警、硬件拓扑、异构硬件支持。这个组件在实际运维中价值很大因为数据中心里往往混着不同批次的服务器、存储和交换机UHM 能把这些异构设备统一纳管不用再分别登录各厂商的管理界面。从部署顺序看常见做法是先部署 FusionCompute 的 VRM 主备节点再部署 FusionManager 主备节点然后通过 FusionManager 的自动发现把物理设备纳管进来。方案文档里提到一套云平台部署一对 FusionManager 主备节点这意味着 FusionManager 本身也是高可用架构不会因为单节点故障导致整个管理面不可用。2.3 资源池划分的操作步骤照着方案落地时资源池划分是第一步要做的决策。具体操作逻辑如下# 以下为 FusionCompute 资源池划分的逻辑步骤说明 # 步骤1登录 FusionCompute VRM 管理界面 # 地址格式https://VRM_IP:8443 # 默认管理员账号在部署时设定 # 步骤2创建物理集群 # 在集群菜单下选择创建集群 # 输入集群名称选择集群内主机的 CPU 类型 # 注意同一集群内主机 CPU 必须同制 # 步骤3将物理主机加入集群 # 在主机菜单下选择添加主机 # 输入主机的 BMC IP、用户名、密码 # 系统会自动发现主机硬件信息 # 步骤4在物理集群下创建逻辑集群HA资源池 # 选择物理集群 - 创建逻辑集群 # 设置调度策略HA、DRS、DPM # 逻辑集群内的主机共享相同的调度策略这段逻辑的核心是先物理集群、再逻辑集群的嵌套关系。物理集群是硬件层面的分组逻辑集群是调度层面的分组。参数上最需要注意的是 CPU 同制要求如果集群内主机 CPU 型号不同HA 和热迁移功能会受限。失败时先看 VRM 的任务日志通常会提示具体是哪台主机的 CPU 不兼容。3. 高可用与热迁移配置HA、DRS、DPM 怎么设才不翻车3.1 HA 的准入控制与预留策略HA 是方案文档里反复强调的能力但文档没写清楚的是 HA 的准入控制策略。FusionCompute 的 HA 有两种准入控制方式按主机数预留和按资源百分比预留。按主机数预留是指定集群内允许几台主机同时故障系统会预留相应资源按资源百分比预留是设定 CPU 和内存的预留比例。我一般会建议客户用按主机数预留因为逻辑更直观。比如一个集群有 8 台主机设定允许 1 台故障系统就会确保剩余 7 台的资源能承载所有虚拟机。如果设定允许 2 台故障预留资源就要更多实际可用资源会减少。这个参数直接决定了集群的抗故障能力和资源利用率之间的平衡。# HA 配置逻辑说明 # 在 FusionCompute 管理界面操作 # 集群 - 配置 - HA配置 # 准入控制策略按主机数预留 # 预留主机数1表示允许1台主机故障 # 虚拟机重启优先级高/中/低 # 心跳存储选择共享数据存储 # 关键参数说明 # - 预留主机数越大抗故障能力越强但资源利用率越低 # - 心跳存储必须选共享存储否则HA无法判断主机状态 # - 重启优先级决定故障时哪些虚拟机先启动心跳存储的选择是个容易踩的坑。HA 依赖心跳来判断主机是否存活如果心跳存储配的是本地盘主机故障时心跳也断了HA 反而无法准确判断。方案文档里提到共享 SAN 存储架构这里就要把心跳存储放在 SAN 上。3.2 热迁移的 CPU 兼容性检查热迁移是方案文档里另一个核心能力但它的前提条件比 HA 更苛刻。热迁移要求源主机和目标主机的 CPU 特性兼容FusionCompute 提供了 CPU 兼容性检查工具。常见做法是在集群配置里开启CPU 兼容模式或者使用基线功能统一 CPU 特性。实际操作中如果集群内主机 CPU 不同制热迁移会直接失败。报错信息通常是目标主机 CPU 特性不兼容。解决办法有两种一是把不同 CPU 的主机分到不同逻辑集群二是在集群级别开启 CPU 兼容模式屏蔽掉部分高级 CPU 特性。后者会损失一些性能但能保证热迁移可用。3.3 DRS 与 DPM 的联动逻辑DRS 是动态资源调度根据集群内主机的负载情况自动迁移虚拟机DPM 是分布式电源管理在负载低时把虚拟机集中到少数主机上把空闲主机下电。这两个功能联动时要注意阈值设置。DRS 的阈值一般设三档保守、中等、激进。保守模式下 DRS 只在负载差异很大时才触发迁移激进模式下会更频繁地迁移。我一般建议生产环境用中等既不会太频繁迁移影响业务也不会让负载严重不均。DPM 的阈值要配合 DRS 设置如果 DPM 太激进主机频繁上下电反而增加故障风险。# DRS/DPM 配置逻辑 # 集群 - 配置 - DRS配置 # DRS阈值中等推荐生产环境 # 迁移阈值设置CPU和内存的触发阈值 # 建议CPU阈值75%内存阈值80% # DPM配置 # 开启DPM是 # 下电阈值CPU利用率低于20%持续30分钟 # 上电阈值CPU利用率高于60%持续10分钟 # 注意DPM下电前会先迁移虚拟机确保业务不中断参数设置的核心逻辑是DRS 管均衡DPM 管节能两者都要避免频繁触发。失败时看 VRM 的调度日志能看到每次迁移的触发原因和目标主机。4. 存储与备份落地SAN 共享存储、HyperDP 与快照策略4.1 SAN 共享存储的配置要点方案文档明确提到通过共享的 SAN 存储架构可以最大化的发挥虚拟架构的优势。这句话的落地含义是虚拟机的系统盘和数据盘都要放在共享存储上而不是本地盘。原因很简单HA 和热迁移都依赖共享存储如果虚拟机磁盘在本地盘主机故障时虚拟机无法在其他主机上恢复。SAN 存储的配置步骤通常是先在存储设备上划分 LUN然后在 FusionCompute 里添加数据存储选择 SAN 类型指定 LUN 的 WWN 或 IQN。添加完成后数据存储会出现在集群的存储列表中创建虚拟机时就可以选择这个数据存储。# SAN 存储添加逻辑 # 存储 - 数据存储 - 添加数据存储 # 类型SAN # 名称自定义建议包含存储设备标识 # LUN选择已划分的LUN # 访问模式读写 # 主机访问选择集群内所有主机 # 关键检查点 # 1. 集群内所有主机都能看到该LUN多路径配置正确 # 2. 存储设备的ALUA模式配置正确 # 3. 多路径策略选择round-robin或least-queue多路径配置是 SAN 存储的常见坑点。如果多路径没配好主机可能只看到一条路径存储链路故障时数据存储直接不可用。常见做法是在主机层面配置多路径软件FusionCompute 自带多路径管理但需要在存储侧配合配置 ALUA 模式。4.2 HyperDP 备份节点的部署逻辑方案文档提到采用华为 FusionSphere HyperDP 备份节点建立完整的数据保护系统并且整个备份云可实现集中管理负载均衡。HyperDP 的部署逻辑是先部署备份节点虚拟机然后在备份节点上配置备份策略指定要备份的虚拟机、备份周期、保留份数。备份策略的参数设置要注意几点备份窗口要避开业务高峰期保留份数要根据存储容量和合规要求确定备份类型要区分全量备份和增量备份。常见做法是每周一次全量备份每天一次增量备份保留 4 周。# HyperDP 备份策略配置逻辑 # 登录 HyperDP 管理界面 # 备份策略 - 新建策略 # 策略名称自定义 # 备份对象选择虚拟机或虚拟机文件夹 # 备份类型全量/增量 # 备份周期每周全量每天增量 # 保留份数4份保留4周 # 备份窗口建议设置在业务低峰期如凌晨2:00-4:00 # 恢复操作 # 选择备份点 - 恢复 - 选择恢复位置 # 支持原机恢复和异机恢复HyperDP 的一个关键优势是集中管理负载均衡这意味着多个备份节点可以协同工作备份任务会自动分配到负载较低的节点。部署时要注意备份节点的资源预留备份过程会消耗 CPU 和网络带宽如果备份节点资源不足备份任务会排队甚至失败。4.3 虚拟机快照与备份的区别方案文档提到提供虚拟机快照备份技术(HyperDP)等这里要区分快照和备份。快照是虚拟机磁盘在某个时间点的状态记录恢复快照会回滚到那个时间点但快照本身占用存储空间且不能替代备份。备份是把虚拟机数据复制到独立的存储位置可以长期保留用于灾难恢复。常见做法是日常用快照做短期保护比如系统更新前打快照用 HyperDP 做长期备份。快照不要保留太久一般不超过 72 小时否则快照链太长会影响性能。备份则按策略长期保留。5. 避坑与排查HA 不生效、热迁移失败、存储掉线的血泪经验5.1 HA 配置了但故障时虚拟机没重启现象集群配置了 HA但手动拔掉一台主机的电源后虚拟机没有在其他主机上重启。原因最常见的是心跳存储没配或配错。HA 依赖心跳存储判断主机状态如果心跳存储是本地盘主机断电后心跳也断了HA 无法确认主机是故障还是网络隔离。另一个原因是准入控制策略设置不当预留资源不足HA 想重启虚拟机但目标主机资源不够。解决检查集群 HA 配置里的心跳存储确保选择的是共享数据存储。检查准入控制策略确认预留主机数设置合理。如果资源不足需要扩容或调整预留策略。5.2 热迁移报 CPU 不兼容现象手动触发热迁移任务失败提示目标主机 CPU 特性不兼容。原因源主机和目标主机的 CPU 型号或特性不同。FusionCompute 的热迁移要求两台主机的 CPU 特性兼容如果一台是 Intel 某代 CPU另一台是不同代次或不同厂商的 CPU就可能不兼容。解决在集群配置里开启 CPU 兼容模式或者使用基线功能统一 CPU 特性。如果兼容模式影响性能可以把不同 CPU 的主机分到不同逻辑集群各自独立管理。5.3 SAN 存储突然不可用现象运行中的虚拟机突然卡死FusionCompute 告警显示数据存储不可访问。原因通常是存储链路故障或多路径配置问题。如果主机到存储的链路只有一条链路中断后数据存储直接掉线。另一个原因是存储设备的 ALUA 模式配置错误导致主机无法正确切换路径。解决检查主机到存储的物理链路确认多路径配置正确。在 FusionCompute 里查看数据存储的路径状态如果只有一条活动路径需要检查存储侧的多路径配置。常见做法是配置至少两条独立路径并启用 round-robin 策略。5.4 备份任务失败但没告警现象HyperDP 备份任务显示成功但恢复时发现备份数据不完整。原因备份窗口设置不合理备份任务在业务高峰期执行虚拟机磁盘变化太快备份数据不一致。另一个原因是备份节点资源不足备份任务被中断但状态没更新。解决把备份窗口设置在业务低峰期确保备份期间虚拟机负载较低。检查备份节点的 CPU、内存、网络资源确保满足备份需求。定期做恢复演练验证备份数据的完整性。5.5 逻辑集群内主机 CPU 不同制导致调度异常现象逻辑集群内部分虚拟机频繁迁移或者 HA 触发时虚拟机无法在指定主机上启动。原因逻辑集群内主机 CPU 不同制DRS 调度时目标主机 CPU 不兼容导致迁移失败或反复重试。解决检查逻辑集群内所有主机的 CPU 型号确保同制。如果无法统一把不同 CPU 的主机分到不同逻辑集群。在集群配置里开启 CPU 兼容模式作为临时方案。6. 扩容与验证在线加主机、加存储、加磁盘框的具体操作6.1 在线扩容主机的操作步骤方案文档提到服务器、存储设备均可根据业务根据需求在线平滑增加服务器、服务器虚拟集群在线扩展磁盘、磁盘框、控制框。在线扩容主机的操作逻辑是先把新主机加入物理集群然后配置网络和存储最后加入逻辑集群。# 在线扩容主机逻辑 # 步骤1新主机上安装 FusionCompute 主机软件 # 步骤2在 VRM 管理界面 - 主机 - 添加主机 # 输入新主机的 BMC IP、用户名、密码 # 步骤3配置新主机的网络业务网络、管理网络、存储网络 # 步骤4配置新主机的存储添加数据存储 # 步骤5将新主机加入逻辑集群 # 步骤6验证 HA 和 DRS 是否识别新主机 # 关键检查点 # - 新主机 CPU 与逻辑集群内其他主机同制 # - 新主机网络配置与集群一致 # - 新主机能访问所有共享数据存储扩容主机的核心约束还是 CPU 同制。如果新主机 CPU 与现有集群不同制只能新建逻辑集群。另外新主机的网络配置要和现有集群一致否则虚拟机迁移后网络不通。6.2 在线扩展存储的操作步骤在线扩展存储包括扩展 LUN 和添加新 LUN。扩展 LUN 是在存储设备上扩大现有 LUN 的容量然后在 FusionCompute 里刷新数据存储容量会自动更新。添加新 LUN 是在存储设备上划分新 LUN然后在 FusionCompute 里添加为新数据存储。# 在线扩展存储逻辑 # 场景1扩展现有数据存储 # 在存储设备上扩展LUN容量 # 在 FusionCompute - 数据存储 - 选择数据存储 - 刷新 # 容量自动更新虚拟机无需停机 # 场景2添加新数据存储 # 在存储设备上划分新LUN # 在 FusionCompute - 数据存储 - 添加数据存储 # 选择新LUN配置访问模式 # 新数据存储可用于新建虚拟机或迁移现有虚拟机 # 关键检查点 # - 扩展LUN前确认存储设备支持在线扩展 # - 添加新LUN后确认所有主机都能访问 # - 迁移虚拟机时注意目标数据存储的容量和性能存储扩容的坑点在于多路径配置。新添加的 LUN 如果多路径没配好可能出现部分主机看不到的情况。常见做法是添加 LUN 后在每台主机上检查路径状态确保至少两条活动路径。6.3 扩容后的验证清单扩容完成后要做一轮验证确保新资源真正可用。验证清单包括新主机是否被 HA 和 DRS 识别、新数据存储是否所有主机可访问、热迁移是否能在新旧主机之间正常执行、HA 故障切换是否覆盖新主机。我一般会做一次模拟故障测试手动把新主机上的虚拟机迁移到其他主机确认迁移成功然后手动关闭一台主机确认 HA 能触发虚拟机重启。这套验证走完扩容才算真正落地。从那以后我每次做 FusionSphere 扩容都会强制走一遍加主机 → 配网络 → 配存储 → 加集群 → 模拟故障的完整流程少一步都可能留下隐患。希望帮到你。本文还有配套的精品资源点击获取
返回列表