ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SDH网络结构与保护机理:网元、时隙与50ms倒换排查实践

SDH网络结构与保护机理:网元、时隙与50ms倒换排查实践 简介《SDH网络结构和网络保护机理.doc》是一份围绕SDH同步数字体系核心原理编写的技术文档适合通信工程专业学生、光传输运维人员及备考通信技术类认证的初学者。全文聚焦第五章内容内容安排由浅入深先说明核心层、汇聚层、接入层的三层架构再系统拆解链形网与自愈环的工作机制包括二纤单向/双向通道保护环、二纤/四纤复用段保护环的自愈过程并对T型网、环带链、相切环、相交环、枢纽网等复杂拓扑以及PDH向SDH过渡策略做了归纳。文档共1个doc文件压缩包约199KB结构完整、目录清晰便于按章节速查。目前已有174人浏览学习可用于快速建立SDH网络保护与可靠性设计的知识框架也可作为课程复习、入职培训或日常排障的参考资料。1. SDH网络结构和保护机理一张三十年前的网络蓝图为何今天仍值得逐行读凌晨两点光缆被施工队挖断。你心里想SDH网络结构里早就配好了保护业务会自动倒换到备用通道应该没有影响。结果网管上告警刷屏业务还是中断了。排查到最后发现设备没有坏是1:1保护组里的备用通道被当普通业务通道占用保护机制压根没机会生效。SDH网络结构和网络保护机理讲的就是两件事业务在SDH网里走哪条路——经过哪些网元、占用哪些时隙这条路断了以后靠什么机制切到备用路径多长时间切完。这个话题适合传输运维、网络规划以及刚从数通转到传送网方向的人细读因为保护机理的设计缺陷往往要在故障发生那一刻才真正暴露。2. 从网元到拓扑SDH网络结构的三层拼图2.1 四种网元TM、ADM、DXC、REG的分工与典型连接SDH网络结构从物理形态上由四类网元拼出来。把网元角色记清楚后面看保护组里谁做发端、谁做收端才不会乱。网元中文全称在组网里的职责典型位置TM终端复用器把2M/155M等低速支路复用进STM-N线路信号也能反向解复用链形末端、环形的一个接入端点ADM分插复用器让高速线路信号在本节点直接上下支路其余时隙穿通继续走环形节点、链形中间站DXC数字交叉连接执行大容量时隙交叉调度灵活改变业务方向核心枢纽机房、多方向汇聚点REG再生中继器对光信号做3R再生再放大、再整形、再定时长距离链路的中间站实际组网里出现频率最高的是ADM。一个STM-4的ADM两个光口分别接环的两个方向支路侧接2M或155M业务板整个环上的业务上下都靠它。TM通常放在网络的端点把用户侧业务汇入传输环。REG只做光信号再生不配置业务交叉但有一个容易忽视的点REG虽然在业务层面透明在开销层面却是需要正确配置透传的如果REG的开销处理方式弄错K字节就会在这一跳被丢掉保护倒换的协商链路随之断开这个到第5章还会再提。组网规模也可以从网元构成判断一个接入环通常是五六个ADM串成环末端接TM一个城域汇聚层会出现ADM与DXC混合组网。如果网元类型里只有ADM和TM而没有DXC那张网的业务方向基本固定调度主要靠人工跳纤完成这本身就说明网络结构处于比较初级的形态后续扩容时DXC的缺位会成为瓶颈。2.2 链形、环形、枢纽形三种拓扑的选型场景SDH组网拓扑不是随便画的每种形态对应一类业务模型。链形用于业务方向明确、可靠性要求不算极端的场景比如乡镇到县城的单向汇聚中间经过两三个ADM。环形的价值在于给业务提供第二条物理路径业务可以顺时针也可以逆时针走是SDH网络保护最常见的物理基础。枢纽形网状拓扑出现在DXC互联的核心区域多路径交叉为SNCP这类子网级保护提供物理走线条件。拓扑优点缺点典型场景链形容量利用率高、投资省中间节点失效会切断全链末端接入、单向汇聚环形天然具备保护空间、倒换简单全网共享容量、扩容需重新规划城域汇聚、本地骨干枢纽形多路径调度灵活、可靠性高交叉配置复杂、建设成本高核心机房之间互联选型时有一个很实际的判断同一条业务环形拓扑让保护变得自然但环上所有节点共享环容量扩容空间受限于环速率链形拓扑容量利用率高但任何一个中间站掉电或光板失效业务都会直接中断通常只能靠11线路保护兜底。枢纽形介于两者之间容量与可靠性的平衡靠DXC的交叉设计实现。所以我做规划时第一件事永远是问“业务是集中型还是分散型”集中型业务适合链加环的汇聚结构分散型业务才值得上枢纽形或环带环结构。2.3 时隙和复用网络结构里的容量边界讲到网络结构绕不开时隙。SDH帧采用STM-N结构最小的常见业务颗粒是VC-12承载2M业务高速颗粒是VC-4约155M。一个STM-1包含63个VC-12或1个VC-4一个STM-4包含4个VC-4等效252个VC-12STM-16就是16个VC-4。业务从支路板进入经过映射、定位、复用最后落到线路板的某个时隙里这就是业务在SDH网络里的“路”。时隙直接影响保护配置。保护组保护的不是“一根光纤”这种物理对象而是光纤上承载的某个VC的端到端连通性。以SNCP为例业务同时从工作通道和保护通道两个方向发送宿端选收一路配置时就要明确每个VC的工作时隙和保护时隙分别落在哪条路径上。时隙规划重叠保护组创建会直接报错时隙规划不连续倒换时可能出现部分业务切过去、部分业务切不过去的现象。所有SDH网络结构问题最终都能落到“哪个业务走了哪个时隙”这一层来验证。节点数量、光纤连接关系和时隙规划共同构成网络结构的三大要素。一张合格的SDH网络结构图应该能一眼看出每条业务的工作路径和保护路径以及两条路径在物理上是否完全分离。如果业务的工作和保护走同一条管道比如同缆但不同纤芯光缆被挖断时两条路径一起失效保护等于虚设。物理路由分离是网络结构设计里最容易被忽视的一环拓扑图和纤芯台账必须放到一起看。3. 保护机理的倒换逻辑50ms承诺是怎么兑现的3.1 线路保护11与1:1备纤的两种用法线路保护是SDH保护里最基础的一类常见模式为11和1:1。11保护下发端把同一路业务永久桥接到工作光纤和保护光纤上同时发送收端对两路信号实时选收只要还能从两路里收到一路业务就不断。1:1保护下发端只在工作光纤上发送业务一旦检测到工作光纤失效发端把业务桥接到保护光纤上同时通过APS信令通知对端切换接收。1:1省下的资源可以让保护光纤在空闲时承载额外业务代价是多一层协商、倒换逻辑更复杂。项目111:1发端动作永久桥接业务双发故障时切换发送收端动作二路选优根据APS信令切换是否需要APS协商基本不需要选收即完成需要K字节交互保护光纤空闲时能否传额外业务不能可以倒换速度最快略慢但都满足50ms工程上怎么选11适合核心骨干层、对中断时间极端敏感的业务因为收端选收是物理层独立的本地动作不依赖对端配合。1:1适合资源紧张、想用保护通道顺带传点低优先级数据的局点。但一定记住额外业务没有保护等级工作光纤故障时会被无条件抢占倒换结束后还需要人工恢复。这个约束要提前跟业务方讲清楚我见过不止一次因为额外业务被抢占、业务方半夜打电话投诉的场景。3.2 SNCP与复用段保护保护颗粒度和资源效率的取舍通道层和复用段层各有一类保护方法。子网连接保护SNCP工作在通道层保护对象是单个VC源端把业务复制到工作通道和保护通道两条独立路径宿端对两条路径同时做检测并选收。SNCP配置直观、颗粒度细、不需要全网协议协商缺点是每个受保护的VC都占两份容量。复用段保护工作在STM-N帧层面把整个复用段内所有时隙当成一个整体来保护。常见形态是二纤双向复用段保护环MS-SPRING核心是靠K字节在环上所有节点之间协商倒换。MSP资源利用效率更高保护容量可以在环上多个节点间共享但配置和运维复杂度明显上升且整个环共享同一个倒换域——任何一个节点的K字节处理异常整环倒换都会受影响。对比项SNCPMSP / MS-SPRING工作层通道层VC复用段层STM-N帧保护颗粒度单VC灵活整个复用段粗粒度是否需要全网协商宿端本地选收基本不协商需要K字节环上协商配置复杂度低高资源效率每VC两份容量保护容量共享工程上的取舍逻辑城域网汇聚层和接入层SNCP用得最多因为它配置简单、倒换确定性强骨干层和容量紧张的环网MS-SPRING更常见因为它可以把一个方向的容量释放出来承载业务。有一种常见误解是“SNCP比MSP高级”实际上二者是不同层级的工具SNCP保护的是管道里的一桶水MSP保护的是整条管道。3.3 APS协议与K字节保护倒换怎么协商APS协议运行在SDH段开销的K1、K2字节上这是理解保护机理协商过程的关键。K1字节携带倒换请求的类型和优先级K2字节描述桥接状态和APS协议状态机。倒换请求不是只有“光断了”一种而是有明确的优先级体系锁定Lockout最高往下依次是强制倒换FS、信号失效SF、信号劣化SD、人工倒换MS、等待恢复WTR。这个优先级体系决定了故障时谁说了算。比如你手动下发了人工倒换此时突然发生光缆中断SF请求会抢占MS请求设备自动进入信号失效倒换而不会理睬人工倒换的后续状态。反过来如果已经执行了强制倒换光缆中断也不能改变当前状态因为FS的优先级高于SF。排障时先看保护组当前倒换原因字段是SF还是SD还是MS就能判断是不是有更高级的请求盖住了你的操作。另外注意APS协议只有在1:1这类需要双方协商的保护方式里才是必须的11的收端选收是本地动作不需要复杂的协议交互。这是很多新手在网管上看“协议状态”字段时发懵的原因11保护组的协议状态永远简单1:1保护组则能看到K字节的收发计数。REG在APS协议里扮演透明转发角色但REG或中间节点的光板如果配置了开销终结K字节就会被吞掉查倒换超时问题时REG的开销处理模式是必查项。最后补充一个环网保护的细节。二纤单向通道保护环本质是SNCP在环网的应用业务同时绕环的两个方向传宿端在收端选收。二纤双向复用段保护环则不同工作通道和保护通道分开倒换时整个环上相关节点参与K字节协商。这两种环对应不同的保护哲学通道保护环牺牲容量换简单复用段保护环牺牲复杂度换容量。很多工程师习惯把二者混为一谈排障时就会拿错定位方向。4. 把保护机理落到网管保护组配置与三个必调参数4.1 保护组配置的最小步骤和角色分配在网管上配置保护组各家产品界面不同逻辑是一致的选保护类型、指定工作通道和保护通道、设置仲裁参数、下发两端网元。配置之前先确认两端光板类型和时隙表一致否则保护组能创建但倒换时会因端口能力不匹配而失败。常见做法是进入SDH设备管理视图打开“保护管理”里的创建保护组向导输入保护组名称和类型。线路保护就选11或1:1并指定工作光口、保护光口子网连接保护就选SNCP把工作路径和保护路径的VC分别拖入对应角色栏。随后设置恢复模式和WTR时间最后下发。配置顺序和关键检查项如下操作步骤关键点常见错误新建保护组命名清晰注明两端站点名称名称无规则事后无法辨识指定工作通道光口、VC-4编号、VC-12时隙范围一致两端时隙不对称指定保护通道确认保护通道物理链路完好保护通道被其他业务占用设置恢复参数恢复模式两端一致一端返回式、一端非返回式下发两端网元确认两端都下发成功只下发一端另一端无感知下发后必须核对运行状态。网管页面上有三个关键字段当前工作角色工作/保护、当前倒换状态正常/倒换中/锁定/等待恢复、当前倒换原因无/SF/SD/MS/EX。如果状态不是“正常”别急着做任何倒换操作先查清楚状态来源。保护组下发是两端动作不是单端动作我遇到过只配了一端导致倒换请求发出去对面没回应的局面。4.2 WTR、恢复模式、额外业务三个必调参数保护组参数里最容易配错的是三个恢复模式、WTR时间、额外业务。恢复模式决定故障恢复后业务要不要自动返回工作通道。返回式适合工作通道质量稳定的场景因为它能把业务带回设计路径非返回式适合保护通道质量更稳定的场景省去回切动作。WTR等待恢复时间是故障排除后、执行回切前的等待时长常见范围5到12分钟。WTR设太短工作通道光功率还在爬升期就回切容易造成“回切-再倒换”振荡设太长业务长时间压在保护通道上如果这段窗口内保护通道也出问题就是双重故障直接中断。我一般给默认业务设8分钟再结合工作通道的历史光功率表现微调。额外业务是1:1保护特有的一项开关。保护光纤空闲时可以承载低优先级业务这叫额外业务它没有保护等级一旦触发倒换会被无条件抢占而且倒换恢复后还需要人工恢复。额外业务的配置有个细节它需要单独指定保护通道上的时隙和业务映射而不是简单勾一个开关。配置前要确认保护通道上有空闲的VC时隙且对端网元的交叉连接预留了对应资源。很多现场把额外业务和普通业务混在同一张时隙表里倒换时额外业务的交叉连接失效就会和现网业务形成冲突。对额外业务没有清晰台账和管理手段时直接关闭这个开关省得后续扯皮。提示WTR和恢复模式一旦在两端设置不一致回切时会出现一端倒换、另一端等待的僵局修改参数后务必两端同时下发。4.3 从网管读保护状态的技巧运维经验在于读状态而不只是看告警。保护组状态是绿色的“正常”不代表一切稳妥打开历史事件列表查有没有出现过SD信号劣化记录。SD意味着信号质量已经下降但未达到倒换门限如果不处理某次光缆稍微再衰减一点就会触发SF倒换。定期查看保护组的倒换计数也是建议动作倒换计数的变化频率是这张网健康度的直接指标。以命令行方式查询保护组状态时常见的一种交互输出是# 查询保护组 A-B-1plus1 的运行状态示意命令 show protection-group status A-B-1plus1 # 输出关键字段 # GroupState Normal # ActiveRole Working # SwitchReason NONE # WTRRemain 0s # SwitchCount 3这段输出的含义保护组状态正常当前业务在工作通道上没有正在进行中的倒换WTR计时器也没有在跑。如果SwitchReason变成SF说明当前正处在信号失效倒换中如果看到WTRRemain在倒数说明一次自动倒换刚刚结束设备正在等WTR时间走完以便回切。SwitchCount等于3表示历史上发生过3次倒换如果这个数每隔几天就涨一次就需要查为什么倒换如此频繁。建议每次巡检把保护组状态截图存档形成基线数据等网络出问题时翻出来对比能省大量排查时间。保护组的告警监视也需要单独设置。默认情况下SDH设备会对保护通道上的信号做性能监视包括误码秒、严重误码秒等指标。这些指标不直接影响倒换但能反映保护通道的健康度。建议把保护通道的ES、SES加入巡检清单与业务通道同等对待——保护通道平时不用一旦要用必须保证它是完好的。5. 保护倒换排查避坑五类典型故障的现象、原因与处理保护倒换的故障排查核心是抓住一条主线倒换请求是否产生、是否被正确传递、是否被执行。任何一步断掉倒换就异常。下面五类故障按现象、原因、处理的顺序整理每一条都是真实运维里反复出现的。5.1 光缆断了保护没动作现象光缆中断网管上报LOS信号丢失但业务还是中断保护组没有发生倒换。原因最常见的是保护组虽然创建了但工作通道和保护通道的交叉连接没有全部配置完整尤其跨网元SNCP宿端两个方向的VC没有配对。另一种可能是保护组处于锁定状态或者保护通道被额外业务占用保护通道不可用。处理在网管上打开保护组详情逐项核对工作通道两端的交叉连接是否是Active状态。如果是SNCP宿端只配了工作通道的交叉另一路信号根本到不了选收板保护等于虚设。用信号流跟踪功能沿业务路径走一遍能快速定位是哪一段交叉断的。锁定状态的解法是找到保护组的Lockout开关并关闭。同时检查WTR状态如果上一次倒换刚结束还没回切此时新的故障可能被WTR状态压住要等计时结束或手动清掉。5.2 倒换时间超过50ms现象用误码仪监测业务VC光纤中断后业务中断时间达数百毫秒不满足50ms的倒换要求。原因对于复用段保护环K字节协商需要环上所有节点参与中间某个节点的APS协议状态异常倒换请求就会在超时后才生效。另一种常见原因是REG或中间节点在开销处理上配置为终结模式K字节没能原样透传到对端。处理先查K字节传递路径重点看REG节点的开销处理模式。再查APS协议状态确认两端网元的协议模式是线性MSP还是共享保护环模式不匹配会出现协商超时。我踩过这个坑一条两站之间的链路中间加了REG光板默认配置把开销终结了K字节被吞倒换时间从50ms级别拖到600ms改成透传后恢复。5.3 恢复后业务闪断现象故障排除后保护组自动返回工作通道的瞬间业务出现几十毫秒到几百毫秒的闪断。原因WTR设置过短故障恢复后工作通道光功率仍在不稳定爬升期回切后业务性能差甚至引发再次倒换。也可能是两端网元WTR时间不一致一端已经回切另一端还没准备好。处理把WTR调长到至少5分钟以上且确保两端一致。回切前检查工作通道的光功率和误码率等完全稳定后再手动执行回切或者直接等自动回切。回切动作尽量安排业务低峰期。另外如果工作通道的光模块存在隐性劣化回切后短时间内会再次触发倒换要提前排查光模块收发光是否正常。5.4 手动倒换失败现象在网管上对保护组下发人工倒换命令系统报错业务没有切换。原因保护组存在锁定状态或者当前存在SF/SD等级别更高的倒换请求人工倒换优先级不够。另一种情况是1:1带额外业务的保护组保护通道被额外业务占用系统出于保护机制拒绝倒换。处理先查保护组的锁定状态并解除再看当前倒换原因列表里有没有更高级别的请求占用。如果是额外业务冲突需要先关闭额外业务功能或手动清掉额外业务再执行倒换。手动倒换失败不见得是配置错误也可能是机制在按优先级工作——这不是故障这属于保护机理的正常裁决。5.5 保护通道劣化导致来回倒换现象保护组频繁出现倒换和回切业务周期性闪断倒换计数快速增长。原因保护通道本身光功率不足或误码超标达到SD保护门限后系统倒换到保护通道结果发现保护通道也不健康又切回工作通道两端来回拉扯。处理出现这种情况第一动作是把恢复模式改为非返回式或调大WTR人为减少振荡频率然后去查保护通道的光路与误码。先查保护通道两端的收发光功率和误码性能用仪表做环回测试定位劣化段落。如果是光连接器脏污用光纤清洁笔处理后再测如果是光板老化需要更换。同时可以调高SD门限中的BER阈值参数让设备对轻微劣化不那么敏感但这是临时手段门限调整要遵循一个原则不能高到真实故障来临时触发不了倒换。保护通道长期不承载业务光路性能问题平时发现不了一倒换就暴露这是SDH运维里的玄学——平时看着正常关键时刻掉链子所以必须有演练做兜底。6. 用一次带业务的保护倒换演练验证网络保护可用性最后说一个我坚持了很久的做法每季度挑一条低优先级业务在业务窗口内做一次真实的保护倒换演练。别直接拔光纤光纤中断会引发大量告警和K字节风暴演练要可控。先在网管上对目标保护组下发人工倒换命令让业务切到保护通道再用SDH分析仪接在业务VC的测试口上记录倒换瞬间的中断时间和误码情况。提示演练前先确认保护组当前没有正在进行的自动倒换否则WTR计时会影响演练结果的判定。判断保护组是否真正可用的标准只有一条倒换时间不超过50ms且无误码。达不到就一定存在第5章里的某种隐性故障演练正好暴露问题达到了才说明这条业务的工作通道和保护通道在物理层上是完整互通的。回切环节同样要测撤销人工倒换观察WTR计时是否触发、业务是否自动回到工作通道且无闪断。如果回切瞬间有误码问题多半出在工作通道的光模块或光纤连接器不是保护配置本身。做这项工作有一条血泪经验演练前务必用短信或工单通知业务方哪怕业务优先级再低也要通知。我经历过一次演练倒换恰好撞上业务方做数据核对被误认为事故。另外每次演练保留保护组状态截图、误码仪截图和倒换计数存档下次排障时这些就是最直接的基线参考。SDH网最值钱的不是设备而是你对这张网保护机理的掌控程度。希望这些经验能帮到你也祝你下次光缆真被挖断时业务能一声不吭地切到备用通道上。本文还有配套的精品资源点击获取
返回列表