ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

H3C S6520 IRF堆叠实战:现网不断网平滑配置与避坑指南

H3C S6520 IRF堆叠实战:现网不断网平滑配置与避坑指南 简介面向现网运维与网络工程师针对核心交换机转发能力不足与高可用升级需求以H3C S6520系列为例完整讲解如何在不中断业务的前提下完成两台设备的IRF2堆叠配置。资源来自真实项目交付覆盖设备型号与软件版本核对、堆叠物理口选择、成员编号与优先级规划、逻辑堆叠口对接规则、BFD分裂检测等关键环节并给出配置前的配置文件备份、业务停机预案以及堆叠失败后的快速恢复思路。压缩包为单份PDF文档容量约395KB内容按现网实施顺序组织包含完整的配置命令、注释说明与操作注意事项适合正在规划核心交换机堆叠的网络管理员与系统集成工程师参考。目前已有1267人学习下载。通过这份资料可快速掌握S6520交换机组建IRF2的规划思路与具体操作深入理解Master竞选、堆叠口绑定等核心机制避开现网中因配置顺序不当、未启用分裂检测而导致的业务中断风险最终实现核心网络带宽翻倍、管理简化与链路冗余。1. 现网堆叠为什么让人发怵加几根线的事搞不好就是全网闪断现网环境下给 H3C S6520 配置 IRF 堆叠最反直觉的一点是堆叠本身不是难点难得是“不断网”这三个字。很多人的第一反应是“堆叠不就是把两台设备用堆叠线连起来、配几条命令吗”但真正操作过的人都知道配堆叠之前要先做兼容性预检、IRF 物理端口规划、成员编号冲突检查一旦中间哪一步没想清楚轻则业务中断几十秒重则整台设备起不来、现场直接翻车。这篇笔记要解决的就是在不中断现网业务的前提下把两台 S6520 平滑地组成一个 IRF 堆叠系统包括前期该查什么、命令怎么写、参数怎么调、哪些坑是花钱买来的血泪经验。适合谁看手上有 S6520 在跑现网业务、想合并成堆叠以提升可靠性和带宽的运维工程师或者正在做网络割接方案、需要评估堆叠可行性的实施人员。我已经用这套思路在多个生产环境里做过 S6520 的堆叠改造下面的步骤和参数都按“能直接照着做”的标准来写如果你只是测试环境随便玩玩那有些预检步骤可以跳过但生产环境一条都别省。2. 先决定堆叠方案IRF 和普通堆叠的区别以及跨设备链路聚合为什么是刚需2.1 IRF 不是“把两台设备连起来”这么简单H3C S6520 系列走的是 IRFIntelligent Resilient Framework技术和传统意义上的“堆叠”有本质区别。传统堆叠往往只是把多台设备的转发平面合并控制平面还是各管各的而 IRF 是把多台物理设备虚拟成一台逻辑设备控制平面、转发平面、管理平面全部统一。对外表现就是一台交换机有统一的 MAC、统一的 IP 管理地址、统一的转发表项。这个区别在现网里意义很大。因为 IRF 的成员设备之间不仅是数据转发通道还要同步配置、同步路由表、同步 ARP 表项。所以配置 IRF 的时候不是简单的“加一条堆叠命令”就完事而是要理解三个核心概念成员编号Member ID、IRF 端口IRF-Port、IRF 域编号Domain ID。成员编号用来区分物理设备IRF 端口是设备之间互联的物理通道域编号用来隔离多个 IRF 系统防止不同堆叠之间的报文串扰。S6520 上常见的 IRF 物理端口是 10GE 光口或 40GE 光口推荐用两个端口做 IRF 链路形成冗余。这里有个很多人容易忽略的点IRF 物理端口一旦被绑定为 IRF 口就不能再当普通业务口用所以规划的时候要留出足够的剩余端口来支撑业务。2.2 不断网的关键不在堆叠本身而在链路聚合如果说 IRF 配置是骨架那么跨设备链路聚合就是让“不断网”成立的血肉。道理很简单堆叠建立之后如果业务流量还走原来的单条物理链路那交换机故障时依然会丢包。真正要做的是把原本分散在两台设备上的业务口用链路聚合Eth-Trunk绑成一个逻辑口成员端口分别落在两台物理设备上。这样一来任何一台设备故障、任何一条物理链路中断流量都能自动切换到剩下的成员口上业务无感知。S6520 的链路聚合有两种模式静态聚合和动态聚合LACP。现网不断网改造时推荐用动态 LACP 模式因为它在成员链路状态变化时能自动协商、自动收敛比静态模式更稳。不过要注意如果对端设备比如服务器、上行路由器不支持 LACP那就只能退回去用静态聚合或者在服务器侧也开启对应的 Bonding 模式。2.3 堆叠建立后设备角色怎么定主设备、从设备和候选设备IRF 系统里有两类角色Master主设备和 Standby从设备。Master 负责整个堆叠系统的管理和控制所有配置都从 Master 下发同步到 StandbyStandby 作为备份Master 故障时接管。还有一种 Standby 候选设备平时只是同步配置不参与转发。这里有个非常关键的实操细节在配置堆叠之前就要想清楚哪台设备做 Master。因为 Master 的选举优先级、成员编号这些参数决定了堆叠建立后哪台设备说了算。如果两台设备都是出厂默认配置谁先启动谁当 Master这在现网里是个隐患——万一你本来想让 A 做 Master结果 B 先起来了后续管理地址、业务配置全跟着 B 走很容易出乱子。所以配置堆叠前第一件事就是给设备规划成员编号和优先级而不是先把线插上再说。参数推荐值说明成员编号Master1Standby2编号小的优先选举 MasterIRF 优先级Master32Standby1默认都是 1优先级高者当选域编号同一套堆叠用同一个值防止和相邻 IRF 系统串扰IRF 链路至少 2 条物理链路单链路不满足不断网要求3. 配置前的四步体检光模块、端口规划、配置备份、业务影响面评估3.1 光模块和线缆兼容性检查这是最容易在实施当天翻车的一步。S6520 的 IRF 口对光模块型号有严格要求用错了模块轻则链路起不来重则端口反复 Up/Down 导致堆叠分裂。我的习惯是提前登到设备上执行display transceiver interface Ten-GigabitEthernet 1/0/x查看光模块的厂家、型号和光功率。H3C 官方认证模块当然最稳但现网里常见的是第三方兼容模块这时候就要特别注意模块的速率和距离规格是否匹配。常见做法是如果 IRF 链路距离在 3 米以内优先用 DAC 高速铜缆因为铜缆比光模块少一层光电转换故障率低、延迟低如果超过 3 米或者需要跨机柜再用 10GE 光模块配合多模光纤。这里有个参数容易踩坑S6520 有的型号光口支持 1G 和 10G 速率自适应但 IRF 口配置时如果两端速率不一致堆叠链路会起不来。所以配置前要确认两端口的速率协商结果一致最可靠的办法是直接用speed 10000固定速率别依赖自动协商。3.2 端口占用预检和业务梳理堆叠改造最怕的就是配到一半发现某个端口被业务占用了只能临时找替代端口然后整个割接方案重新排期。所以提前一天跑一遍display interface brief和display current-configuration把所有端口的使用情况拉出来主要看三个维度哪些口接的是服务器、哪些口接的是上行链路、哪些口是空着的。IRF 口必须用空口如果有业务占用了候选口要么提前调整业务要么换别的口做 IRF 链路。另外还要看一个东西——设备上有没有跑 VLAN Interface、路由协议、ACL 这类全局配置。因为堆叠建立后Standby 设备的配置会被 Master 覆盖如果 Standby 上有独有配置没有同步到 Master堆叠完成后这些配置就丢了。很多人在这一步疏忽结果堆叠建好后某个业务 VLAN 的网关地址消失了排查半天才发现是 Standby 的配置被覆盖掉。3.3 配置备份今天做堆叠回退方案也要今天写说句不太好听但很实在的话凡是做现网割接没有回退方案的割接都是裸奔。配置堆叠之前必须把两台设备的配置完整备份下来而且不能只是display current-configuration看一眼就算完要真正导出来存档。S6520 的配置文件存在flash:/下一般在flash:/startup.cfg备份的命令是backup startup-configuration to flash:/pre-irf-backup.cfg这条命令会把当前启动配置完整复制到指定文件。注意命令里的文件名要写完整不要用简写。备份完之后再执行display saved-configuration确认备份文件的修改时间确保是我们开始操作之前的最新配置。这样一旦堆叠建立失败可以直接用startup saved-configuration pre-irf-backup.cfg恢复原配置不用现场重新敲几十条命令。3.4 影响面评估什么时候做、哪些业务会被打断即使做了跨设备聚合堆叠建立的过程也不是绝对零中断。设备在重启加入堆叠时Standby 设备上的所有业务端口都会短暂 Down 一下这是物理层面的必然现象。所以割接窗口的选取要看业务特性如果是办公网深夜做问题不大如果是生产数据库、交易系统这种对丢包零容忍的场景就要和业务方确认好 1-2 分钟的维护窗口。我的经验是把整个操作拆成三个阶段预检和备份不影响业务→ 配置 IRF 口和参数也不影响业务→ 重启设备加入堆叠有短暂中断需在窗口内完成。前两步完全可以提前做完第三步控制在 5 分钟以内。4. 核心配置步骤从单机到 IRF 堆叠的最小命令集与参数解释4.1 先配成员编号和优先级不要让设备随机当选 Master堆叠配置的第一步不是连堆叠线而是先规划成员编号和优先级。登录计划作为 Master 的设备把成员编号设为 1、优先级设为 32登录计划作为 Standby 的设备把成员编号设为 2、优先级保持默认 1。这样即使两台设备同时上电也会按照“优先级优先优先级相同则看成员编号”的规则选出 Master。[S6520-Master] irf member 1 priority 32 [S6520-Master] irf member 1 description MASTER-S6520第一行是把本设备成员编号设为 1 并且设置优先级为 32第二行是给这个成员加描述信息方便后期维护时看display irf能一眼认出哪台是 Master。参数说明irf member后面的数字是成员编号取值范围一般是 1-9编号在整个 IRF 系统里必须唯一。优先级范围是 1-32数字越大越优先当选 Master。这两条命令配置后立即生效不需要重启但要注意配置完优先级后如果当前设备已经是 Master 了修改成员编号会触发设备重启所以这个操作要在堆叠建立之前做。4.2 绑定 IRF 端口两条链路是底线成员编号确定后接下来就是绑定 IRF 物理端口。S6520 的 IRF 口逻辑上叫IRF-Port1和IRF-Port2分别对应成员 1 和成员 2 的互联通道。配置思路是Master 的 IRF-Port1 连接 Standby 的 IRF-Port2Master 的 IRF-Port2 连接 Standby 的 IRF-Port1交叉连接。[S6520-Master] interface Ten-GigabitEthernet 1/0/49 [S6520-Master-Ten-GigabitEthernet1/0/49] port link-mode bridge [S6520-Master-Ten-GigabitEthernet1/0/49] quit [S6520-Master] irf-port 1/1 [S6520-Master-irf-port1/1] port group interface Ten-GigabitEthernet 1/0/49 [S6520-Master-irf-port1/1] quit [S6520-Master] irf-port 1/2 [S6520-Master-irf-port1/2] port group interface Ten-GigabitEthernet 1/0/50这段命令的核心逻辑是先把物理口设置为二层桥接模式然后加入对应的 IRF 口组。irf-port 1/1的意思是“成员 1 的 IRF 端口 1”port group interface把物理口绑定到这个 IRF 口下。参数说明1/0/49里的1是成员编号0是槽位号49是端口号。注意这台设备上物理端口编号在堆叠配置前后会变——堆叠建立后Standby 的端口编号会从2/0/x重新排列这在配置链路聚合时要特别注意。4.3 配置 MAD 检测堆叠分裂后的保命符IRF 有个常见故障叫“堆叠分裂”——IRF 链路断了两台设备都认为自己是 Master同时对外提供服务导致网络中出现重复的 IP 和 MAC整个网络直接瘫痪。解决这个问题的机制叫 MADMulti-Active Detection目的就是在堆叠分裂时让其中一台设备进入 Recovery 状态主动关闭自己的业务口。S6520 上推荐用 BFD MAD 检测因为它是独立于 IRF 链路的检测通道分裂时能快速发现。配置方法是启用一个专门的 VLAN把两台设备的特定端口加入这个 VLAN然后在 VLAN 接口上启用 BFD MAD[S6520-Master] vlan 4094 [S6520-Master-vlan4094] quit [S6520-Master] interface Ten-GigabitEthernet 1/0/48 [S6520-Master-Ten-GigabitEthernet1/0/48] port link-type trunk [S6520-Master-Ten-GigabitEthernet1/0/48] port trunk permit vlan 4094 [S6520-Master-Ten-GigabitEthernet1/0/48] quit [S6520-Master] interface Vlan-interface 4094 [S6520-Master-Vlan-interface4094] mad bfd enable [S6520-Master-Vlan-interface4094] mad ip address 10.0.99.1 24这段的逻辑是VLAN 4094 作为专用的 MAD 检测 VLAN不承载任何业务两台设备各出一个端口对连作为 BFD 检测链路mad bfd enable在 VLAN 接口上启用 BFD MADmad ip address给这个检测接口配置虚拟 IP。参数说明MAD 检测用的 VLAN 建议用 4094 这种高位 VLAN避免和业务 VLAN 冲突检测链路端口可以用任意一个空闲端口但建议用千兆口就够不需要占用 10GE 口。这里有个细节容易被忽略MAD 检测链路必须在 IRF 链路之外单独走一条物理线路不能和 IRF 链路共用否则 IRF 链路一断检测链路也断了MAD 就废了。4.4 保存配置并重启让 Standby 加入堆叠两台设备都配置完成后先用save force保存配置然后在 Standby 设备上执行reboot。重启过程中 Standby 会通过 IRF 链路发现 Master 并完成版本同步和配置同步最终两台设备合并成一个逻辑设备。这里有个经验重启 Standby 之前最好先确认 IRF 物理链路是通的可以用display irf link查看 IRF 链路状态。如果链路状态不是 Up先排查光模块和线缆别急着重启。重启完成后登录 Master 设备执行display irf看到两台设备的成员信息都在列表里Role 一栏分别是 Master 和 Standby就说明堆叠建立成功了。此时再执行display device确认两台设备的 Startup 状态都是 Normal没有出现 Reconfiguration 之类的异常状态。5. 业务平滑迁移链路聚合改造、成员端口迁移与跨框冗余验证5.1 把业务端口改造成跨设备链路聚合堆叠建立只是第一步离“不断网”还差最关键的一步把原来单条业务链路改成跨设备 Eth-Trunk。这里以服务器双网卡接入两台 S6520 为例。假设服务器原来的网卡接在 Master 的 1/0/1 口现在要新增一根线接到 Standby 的 2/0/1 口两边配置同一个 Eth-Trunk。[S6520-Master] interface Bridge-Aggregation 10 [S6520-Master-Bridge-Aggregation10] link-aggregation mode dynamic [S6520-Master-Bridge-Aggregation10] quit [S6520-Master] interface Ten-GigabitEthernet 1/0/1 [S6520-Master-Ten-GigabitEthernet1/0/1] port link-aggregation group 10 [S6520-Master-Ten-GigabitEthernet1/0/1] quit [S6520-Master] interface Ten-GigabitEthernet 2/0/1 [S6520-Master-Ten-GigabitEthernet2/0/1] port link-aggregation group 10注意看最后一条命令里我用的是2/0/1——这个端口就是原来的 Standby 设备上的物理口堆叠建立后它的编号前缀从 1 变成了 2。这就是为什么前面说要提前理解 IRF 成员编号对端口编号的影响。配置完成后聚合组里有两个成员口分别落在两台物理设备上。服务器的网卡如果支持 LACP两端会协商成功聚合口进入 Selected 状态。参数说明Bridge-Aggregation 10是聚合口的编号可以自由选择但建议和业务 VLAN 对应关系写清楚link-aggregation mode dynamic是启用 LACP 动态协商port link-aggregation group 10是把物理口加入聚合口。这里有个参数值得注意动态聚合口默认的收敛时间比较快但如果对端设备不支持 LACP聚合口会出现 Selected 口为 0 的情况这时候就要换成静态聚合模式。5.2 成员端口迁移把管理地址和网关平滑挪到堆叠系统业务口改成聚合之后还有一类端口要做迁移——各种虚拟接口。比如原来单机模式下 VLAN 接口的 IP 地址是 192.168.1.1堆叠后如果只在 Master 上配置了Standby 会自动同步这个不用额外操作。但要注意的是如果原来两台设备的 VLAN 接口地址规划不合理比如 Master 上 VLAN 10 是 192.168.10.1Standby 上 VLAN 10 是 192.168.10.254堆叠建立后配置同步时会产生冲突后者会被覆盖。所以在堆叠前就要统一规划 VLAN 接口 IP确保两台设备上没有重复且不一致的三层配置。管理地址的迁移也一样。堆叠系统对外只有一个管理 IP原来两台设备各自的管理 IP 只能保留一个。我一般把 Master 的原管理 IP 保留作为堆叠管理地址Standby 的管理 IP 释放掉。这样运维后续只需要 SSH 登录一个地址就能管理整个堆叠系统。5.3 IRF 版本升级堆叠状态下的两种升级方式怎么选如果堆叠建立后发现两台设备的软件版本不一致——比如一台是 R63xx另一台是 R65xx——IRF 会以 Master 的版本为准把 Standby 版本自动同步成 Master 的版本。这个过程会触发 Standby 设备重启业务会有一次短暂中断。S6520 这类 V7 平台设备如果版本跨度不大可以尝试用 ISSUIn-Service Software Upgrade方式升级做到业务基本不中断。但 ISSU 对版本跨度有要求跨大版本比如从 R6 跳到 R9基本不支持这时候只能用快速升级——也就是手动在 Standby 上加载新版本并重启再主备切换升级 Master。我实际操作的结论是如果现网业务对中断极其敏感就做两次窗口分别升级两台设备如果业务容忍 1 分钟中断就直接让 IRF 自动同步版本一次性完成。别在现网上强行用 ISSU 跨大版本翻车概率很高。5.4 堆叠分裂演练验证 MAD 真的能兜底配置完成不代表验证完成。我每次做完堆叠都会做一次“分裂演练”在维护窗口内人为拔掉一根 IRF 链路看堆叠是否分裂、MAD 是否生效、业务是否还在走跨设备聚合链路。具体做法是拔掉 IRF 主链路后观察 Master 上的display irf和display mad verbose正常情况下其中一台设备会进入 Recovery 状态业务口被关掉另外一台继续正常工作。演练结束后恢复 IRF 链路Recovery 设备会自动重启并重新加入堆叠。这里有个坑如果 MAD 配置有问题拔掉 IRF 链路后两台设备同时活跃业务瞬间双主网络广播风暴直接起来。所以这个演练一定要在窗口内做而且要提前准备好恢复方式——最快的方式是直接把 IRF 链路插回去让两台设备重新协商。6. 现网堆叠避坑笔记六条用真金白银换来的踩坑记录6.1 光模块不匹配导致 IRF 链路反复 Up/Down现象IRF 链路在配置完成后一直在 Up 和 Down 之间反复横跳堆叠始终建立不成功。原因两端用的光模块一个支持 10GE另一个只支持 1GE速率协商失败或者一边用了多模模块、一边用了单模模块光纤类型对不上。解决先执行display transceiver interface查看两端模块的速率、波长和传输距离确保规格一致然后把 IRF 物理口速率手动固定为speed 10000不要依赖自动协商。如果模块本身不兼容直接换 DAC 铜缆最省事。6.2 堆叠建立后 Standby 业务口全部 Down业务中断超出预期现象重启 Standby 加入堆叠后Standby 上原本在跑业务的端口全部变成 Down业务中断时间比预想的长很多。原因配置堆叠前没有把 Standby 的业务配置同步到 Master堆叠建立后 Standby 的配置被 Master 覆盖端口被恢复成默认状态Down。解决操作顺序很重要。先备份 Standby 配置把 Standby 上的业务配置在 Master 上先配好确认 Master 的配置完整覆盖业务需求后再重启 Standby 加入堆叠。如果业务配置已经被覆盖了就用备份文件恢复 Standby 配置然后再重新规划同步。6.3 堆叠分裂后 MAD 没有触发网络广播风暴直接打瘫全网现象IRF 链路断开后两台设备没有进入 Recovery 状态网络里出现了两个相同的网关 MAC整个广播域被风暴淹没。原因MAD 检测链路和 IRF 链路走了同一根线缆IRF 链路一断MAD 检测也断了或者mad bfd enable配置漏了只配了 VLAN 没启用检测。解决MAD 检测链路必须独立于 IRF 链路。IRF 可以用两根 10GE 口互联MAD 检测单独走一个千兆口单独拉一根线。配置完后用display mad verbose确认 MAD 状态是 Enabled。6.4 聚合口对端不协商Selected 口数量为 0现象Eth-Trunk 配好后display link-aggregation verbose显示 Selected 口为 0业务全部不通。原因对端设备比如服务器网卡没有开启 LACP 或者不支持动态 LACPEth-Trunk 工作在动态模式下协商失败。解决把聚合模式改成静态——undo link-aggregation mode然后重新把成员口加入聚合组。如果是服务器侧的问题需要在服务器网卡上开启 802.3ad Bonding 模式。还有一个小坑确认两端聚合口编号和成员端口数量一致一端是 2 个成员口另一端只配了 1 个也会出现 Selected 口数量不一致。6.5 成员编号冲突设备无法加入堆叠现象第二台设备重启后一直无法加入堆叠display irf里只看到一台设备。原因两台设备的成员编号都配置成了 1或者新设备没有单独配置成员编号就直接接了 IRF 线。解决在接 IRF 线之前就分别登到两台设备上确认成员编号。第二台设备的命令是irf member 2执行后设备会提示需要重启生效一定要在接入 IRF 链路之前完成重启。这个顺序错了后面怎么查都找不到原因。6.6 堆叠建好才发现端口编号全变了原来的配置全部失效现象堆叠建立后原本写在 Standby 上的端口配置比如interface GigabitEthernet1/0/1全部看不到业务流量了。原因IRF 成员编号改变后端口编号前缀也随之改变。原 Standby 的端口从1/0/x变成了2/0/x写在旧编号上的策略、ACL、端口属性全部失效。解决做端口配置的时候特别是 ACL 或 QoS 策略里引用了端口编号的要在堆叠建立后重新检查一遍。我的习惯是堆叠后跑一次display current-configuration | include interface把所有端口相关配置拉出来对比新旧编号差异。7. 收尾验证与回退技巧最后 10 分钟决定这次割接是成功还是翻车堆叠配置完成后的收尾验证我有一套固定动作。先登录 Master 执行display irf确认成员列表完整、状态正常再看display irf topology确认拓扑没有异常然后到业务服务器上 ping 网关观察丢包情况。如果条件允许直接拔掉一根聚合成员口看业务是否无感切换——这是“不断网”最硬核的验证方式。回退方案一定要写在割接文档里而且要预演过。最坏的情况是堆叠建立后业务异常回退步骤就是把 IRF 配置从两台设备上删掉undo irf-port和undo irf member然后重启设备恢复成单机模式再用配置备份把原有配置恢复。注意恢复前要把 Eth-Trunk 配置也拆掉不然单机模式下聚合口匹配不上。最后分享一个习惯我做完堆叠从来不当场宣布“完成”而是再观察 15 分钟看有没有 ARP 波动、STP 重新计算、光模块告警。之前在一家工厂做割接时堆叠配置完看起来一切正常结果 20 分钟后上行接口光衰告警才发现有一根光纤被机柜盖板压到了。所以我的规矩是“配置完成不叫完成观察期结束才叫完成”。这个习惯帮我挡住过好几次差点翻车的现场希望帮到你。本文还有配套的精品资源点击获取
返回列表