ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

华为路由器巡检指南:掌握display命令,快速定位设备故障

华为路由器巡检指南:掌握display命令,快速定位设备故障 搞网络这一行最怕的不是设备出故障而是故障来了你两眼一抹黑不知道从哪里下手。我见过太多刚接触华为路由器的朋友上来就敲display current-configuration看配置折腾半天发现配置没问题最后才意识到设备早就因为温度过高悄悄重启过了。所以说查看设备基本状态才是所有排查工作的入口配置层面的问题往往要排在状态检查之后。这篇文章想聊的就是这件事拿到一台华为路由器无论你是刚拆箱的新设备还是已经跑了一两年的老设备应该用哪些命令、从哪些维度、按什么顺序把它的“身体状况”摸清楚。内容覆盖家用路由器的Web管理界面和企业级ARAccess Router路由器的命令行CLI两条路线核心以命令行为主。如果你平时主要接触的是华为AR系列、NE系列这些企业级设备这篇对你的帮助会更大如果你用的只是家里的华为AX3 Pro我也会顺带说清楚Web界面里怎么看状态。文章里涉及的display命令都是VRP系统里最常用的建议直接收藏后面排查故障时照着敲就行。1. 先搞明白查看“基本状态”到底是在查什么很多人对“基本状态”这四个字的理解比较模糊。有人觉得看看指示灯不就完了有人以为看一眼CPU负载就叫看状态了。实际上路由器的基本状态是一个多维度的概念大致可以拆成下面五层第一层是设备身份与运行时长。包括设备型号、软件版本、序列号、启动时间、运行了多久。这些信息决定了你手头这台设备的“基础盘”后续所有排查都要拿它当参照。比如设备昨天刚启动过那今天出现的问题大概率跟重启有关版本太老很多特性不支持或者有已知缺陷很多问题压根不用查直接升级版本解决。第二层是硬件健康度。电源是否正常、风扇转速是否稳定、设备温度是否在合理范围、单板是否在线。这一层在企业级设备上尤其重要因为AR系列路由器往往在机柜里一待就是好几年环境差、灰尘多、夏天机房空调不给力的情况非常常见。我在现场遇到过因为风扇积灰导致转速下降设备温度一路飙到70°C以上自动关机的这就是典型的硬件状态没有日常监控的后果。第三层是接口与链路状态。每个物理接口是Up还是Down协商出的速率、双工模式是什么有没有错包、丢包、CRC校验错误。链路层面的问题占了路由器故障的很大一部分而这一层恰恰是Web界面看不到、新手最容易忽略的。第四层是系统资源占用。CPU使用率、内存使用率、会话数、路由表条目数。CPU高不一定有故障但持续高位一定要警惕内存泄漏在路由器上也并不罕见很多设备越跑越慢最后重启都和内存慢慢被吃光有关。第五层是事件与日志。系统有没有产生告警、日志里有没有异常记录、设备有没有被错误操作过。这些信息是事后追溯问题根因最重要的依据。把这五层都看一遍你这个“基本状态”的检查才算做完整。下面我从接入方式讲起逐步把这五层拆开揉碎。2. 接入设备的准备工作Console、SSH、Web三种方式怎么选2.1 Console本地登录最可靠的兜底方式Console口是路由器上最“原始”的管理入口。新设备刚开箱、配置还没初始化、网络还没通的时候只有通过Console口能进到命令行。你需要一根Console线一端接路由器的Console口另一端如果是串口就插电脑串口如果是USB口就把对应驱动装好。Windows上用SecureCRT、PuTTY或者Xshell都行关键参数是波特率9600华为VRP默认数据位8停止位1奇偶校验无流控无如果你以前没连过Console口最容易栽的坑是USB转串口驱动没装好或者设备管理器里看不到对应COM口。解决方法是以管理员身份运行驱动安装程序装完拔插一次USB线再确认端口号。Console口登录还有一个绕不开的话题console密码忘了怎么办。华为路由器有一套密码恢复机制思路是重新启动设备在启动过程中进入BootROM菜单选择跳过配置文件启动或者清空console密码配置。要注意的是这种方式会中断设备运行而且在某些场景下可能导致配置文件丢失或恢复为出厂状态。我个人的建议是平时一定要定期备份配置把配置文件导出到本地保存这样即使真走到密码恢复这一步也能快速恢复业务。2.2 SSH远程登录日常管理和巡检的首选Console口只能在设备旁边用日常巡检不可能每次都物理接线上。只要设备已经配好了IP地址、路由和管理权限SSH就是最好的选择。在电脑上打开PuTTY或Xshell填入管理IP和端口22用用户名密码登录即可。华为路由器默认情况下SSH服务是要手动开启的需要在系统视图下做类似这样的配置[Huawei] ssh user admin [Huawei] ssh user admin authentication-type password [Huawei] ssh server enable从安全角度考虑远程管理建议优先用SSH不要开Telnet因为Telnet的密码和业务数据都是明文传输的在局域网里抓个包就能看到账号密码。2.3 Web管理界面家用路由器和小型分支的首选如果你用的是华为家用路由器或者企业场景下开启了Web管理功能直接在浏览器里输入管理IP家用一般是192.168.3.1或192.168.1.1企业设备需要单独配置就能进入Web图形界面。家用华为路由器的状态信息主要分布在几个地方首页能看到网络是否正常、在线设备数量、Wi-Fi信号强度在“更多功能”里的“系统信息”或者“设备状态”菜单能看到CPU使用率、内存使用率、固件版本、运行时间在“我要上网”里能看到WAN口的IP地址、DNS、连接方式等信息。手机端用“华为智慧生活”App也能看到这些数据而且还能看家里的网络拓扑和设备实时流量这对普通用户来说确实比命令行友好得多。不过Web界面能提供的信息终究有限。遇到比较深的链路问题、协议问题、硬件告警最终还是得回到命令行。所以我下面的内容以CLI为主这也是华为AR路由器上最常用、最完整的查看方式。3. 第一组命令三分钟内看清设备“底细”3.1 display version型号、版本、运行时间一次看全登录设备之后我第一个敲的永远是这条Huawei display version输出会包含硬件型号、软件版本、BootROM版本、编译时间、设备运行时间等信息。举个例子Huawei AR2220E Router uptime is 2 weeks, 3 days, 4 hours, 12 minutes Hardware version : AR2220E VER.A Software version : V200R009C00SPC800这里我特别想强调uptime这个字段。它表示设备从上次启动到现在已经运行了多长时间。如果一台设备本来已经稳定运行几个月结果某天突然发现 uptime 变成了1 hour那说明设备在最近一小时里重启过可能是人为重启、电源波动、软件崩溃等。不要小看这个细节很多看起来莫名其妙的网络问题最后复盘时发现根因就是一次悄悄发生的重启。Software version同样重要。华为VRP的版本命名规律是 V200R009C00SPC800其中R009是大版本SPC800是补丁版本。如果设备版本偏低很多问题升级就能解决。3.2 display device硬件“温度计”和“体检仪”Huawei display device这条命令用来查看设备各个硬件的状态重点看三类信息设备模块状态字段正常值参考电源模块Present/Status所有电源 Status 应为 Normal风扇模块Present/Status风扇转速正常无告警单板Online/Status单板应处于 Online 且无故障温度传感器Current当前温度环境温度25°C时通常应低于60°C企业级设备的温度问题是很多隐性故障的元凶。我曾经处理过一台AR系列设备业务时好时坏接口频繁闪断一开始一直在查光模块和链路后来才发现机柜里散热风扇坏了设备温度飙到接近阈值。display device输出里的温度告警字段当时已经把问题标出来了只是排查顺序不对白折腾了半天。华为高端一些的设备还支持display temperature all可以直接看所有温度传感器在不同档位下的阈值用来判断当前温度距离告警线还有多远非常直观。3.3 display esn 和 display manuinfo报修时的“身份证”设备送修、申请许可、核对资产的时候需要提供序列号。用这条命令就能拿到Huawei display esn输出一串类似2102351234567890的序列号。如果你要做资产管理或者联系支持中心还需要更详细的制造信息这时候用Huawei display manuinfo里面包含设备型号、制造日期、序列号等字段。日常巡检不一定每次都要看但首次接管设备时建议记录归档。4. 第二组命令接口状态是整个网络的脉搏4.1 display interface brief一眼扫完所有接口的链路状况链路状态是路由器健康度里最灵敏的指标。我先说两条命令的区别display interface brief只看接口名称、物理状态和协议状态display ip interface brief除了物理和协议状态还显示接口的IP地址以display interface brief为例输出大概是Interface PHY Protocol GigabitEthernet0/0/0 up up GigabitEthernet0/0/1 down down GigabitEthernet0/0/2 up down解释一下怎么看第一个字段是接口名第二个字段是物理层状态。物理层 down 说明网线没插好、对端设备没通电、或者光模块收发光异常。第三个字段是链路层/协议状态。物理层 up 但协议 down常见原因是对端接口被 shutdown、两端配置不在同一网段、或者封装方式不匹配。看到up/down物理层 up、协议层 down这种组合时第一时间就应该想到“二层或三层配置不一致”而不是怀疑线缆。很多新手在这里容易走弯路。4.2 display interface单接口深挖错误计数一看便知brief形式适合快速扫描但要深挖某个接口的具体问题必须看完整版Huawei display interface GigabitEthernet0/0/0输出很长重点关注这几个字段Current state当前物理状态 up 或 downLine protocol current state协议状态Input rate / Output rate实时进出速率判断是否存在流量拥塞Input errors / Output errors错误包数量CRC循环冗余校验错误这个字段如果持续增长说明链路质量差常见于网线过长、电磁干扰、光信号衰减我自己的习惯是敲完display interface后先看 CRC 错误有没有增长。如果短时间内 CRC 从几百跳到几万那基本可以判定物理层有问题。对于光口还需要进一步看光模块状态。4.3 display transceiver光模块的“眼科检查”如果你的接口是光口这条命令是必备的Huawei display transceiver interface GigabitEthernet0/0/0 verbose核心看三个光参数参数含义警惕信号TX Power发送光功率偏低于阈值下限说明发光衰减模块可能要报废RX Power接收光功率偏低常见于光纤脏污、弯曲过大、对端发光差Temperature光模块温度持续偏高说明模块散热不良容易导致误码机房环境里最常见的光路故障不是模块坏了而是光纤接头被灰尘污染。碰到接收光功率低的情况用光纤清洁棒擦一下两端接头很多时候直接恢复正常比换模块便宜太多。这也是我每次排查光链路都会优先做的一件事。4.4 顺带记一下ARP表和MAC表也属于“状态”严格来说ARP表和MAC地址表不属于设备基本状态但排查连通性问题时价值非常高。你可能是因为“华为路由器mac与ip绑定命令”搜到这篇文章的那我顺带说明白排查链路时怎么看待这两个表。display arp查看IP地址和MAC地址的对应关系。如果某个IP的ARP解析不到说明二层链路有问题。如果ARP条目一直在变化可能存在IP地址冲突。display mac-address查看MAC地址表适合排查二层环路和终端接入问题。在实际配置IP-MAC绑定之前先用这两条命令把真实对应关系梳理清楚才是正确操作顺序。绑定本身用arp static命令即可但千万别在没理清现状的情况下瞎绑否则终端上不了网你还会误以为设备坏了。5. 第三组命令CPU、内存、告警和日志设备的“体检报告”5.1 display cpu-usageCPU 高了不一定有故障但持续高位一定要查Huawei display cpu-usage输出会给出5秒、1分钟、5分钟三个时间窗口的CPU使用率以及每个进程占用的CPU比例。看CPU状态有两个层次层次一看总占用率是否超过80%。短时间超过80%可能只是瞬时流量高峰但长期在80%以上设备转发性能会明显下降丢包、延迟抖动都会跑出来。层次二看是哪个进程占用了CPU。VRP系统里RM路由管理模块、AAA认证模块、FWD转发模块等都是常见的高占用进程。比如你发现某个ACL的匹配计数异常增多同时CPU升高那大概率是设备受到了大量匹配该ACL规则的数据包冲击。这个场景下你需要一边看display acl的计数一边排查流量来源而不是盲目删ACL。5.2 display memory-usage内存涨了又降是正常只涨不降要警惕Huawei display memory-usage内存使用率正常在60%到80%之间浮动都算合理因为VRP系统本身要缓存路由表、ARP表、会话表等等。但如果看着使用率一天比一天高而且设备重启前已经逼近90%甚至95%就要高度怀疑有内存泄漏问题。这里有个经验内存告急的初期设备往往还能正常工作只是会话表被反复强刷导致上网卡顿。很多用户报“网络慢、网页打不开”你清完缓存不见效果最后重启设备恢复了过一阵又复发基本就是进程内存泄漏。碰到这种最好的办法是升级到修复版本的VRP而不是隔三差五重启。5.3 display alarm active 和 display logbuffer故障现场的“录音笔”Huawei display alarm active这条命令列出现存的活跃告警包括告警级别、告警内容、发生时间。告警级别从高到低分为Critical、Major、Minor、Warning。看到Critical级别告警基本可以判断设备的某些核心功能已经受影响了需要第一时间处理。Huawei display logbuffer日志缓冲区里记录了设备最近产生的所有日志按时间倒序排列。这条命令在故障定位中的价值怎么强调都不过分。比如你怀疑设备发生过重启日志里会有系统重新启动的记录结合display version里的 uptime 信息就能互相印证。又比如端口闪断日志里会记录GigabitEthernet0/0/0 turn ON/OFF之类的事件配合时间戳就能判断闪断的频率和规律性。5.4 display power 和 display fan别等设备断电才发现风扇坏了企业级路由器在机柜里运行时电源和风扇的状态往往是被忽视的。原因很简单它们平时不出问题出问题就是大问题。Huawei display power Huawei display fan这两条命令分别检查电源模块和风扇模块的运行状态。电源部分要注意是否存在单电源运行风险如果本来配了双电源却坏了一个系统还能工作但已经失去了冗余能力。风扇部分要注意转速是否在正常范围内转速偏低或者为零时温度升高只是时间问题。我强烈建议把电源、风扇、温度这三项纳入日常巡检的固定检查项尤其在夏天或者机房空调不够用的场景下。6. 从状态到决策把异常输出和常见故障关联起来查看状态不是为了看而看最终要落到决策上。下面我整理了一份我平时排查用的速查逻辑帮你把上面的状态输出和问题现象串起来。现象优先查看的命令常见原因接口 down/downdisplay interface、display transceiver网线/光模块故障、对端断电、端口被 shutdown接口 up/downdisplay interface、display ip interface briefVLAN不匹配、网段不一致、封装不一致网络时好时坏display interface 查看 CRC、display logbuffer线路老化、光模块污染、电磁干扰CPU持续偏高display cpu-usage、display logbuffer广播风暴、流量攻击、ACL匹配异常内存持续偏高display memory-usage、display logbuffer路由表过大、内存泄漏、缓存异常设备频繁重启display version 看 uptime、display logbuffer电源不稳、温度过高、软件异常设备温度过高display device、display fan风扇损坏、灰尘堆积、机房空调不足某终端无法上网display arp、display mac-addressIP冲突、MAC绑定错误、端口隔离举个例子。有一台AR路由器用户反映某几个网段的终端经常断网断几十秒又恢复。我先看display logbuffer发现大量端口闪断记录再看display interfaceCRC错误计数一直在涨。结合现象判断是物理层问题。现场检查发现网线从机柜走线桥架穿过经过空调管道附近长时间老化导致线对信号衰减严重换了一根网线后问题彻底消失。整个过程没有改任何配置纯粹靠状态信息定位。再举一个“华为路由器配置acl”相关的场景。有台设备CPU经常飙到90%以上业务受影响。用display cpu-usage看到是某个进程占用高进一步看display logbuffer发现有大量丢弃日志再用display acl rule all查匹配计数发现一条ACL规则的计数暴增。顺着来源IP一查是某台终端中了恶意程序在持续发包。用ACL把来源IP拉黑后CPU马上回落业务恢复。这里顺带说说“mac与ip绑定”和状态查看的关系。很多场景下IP-MAC绑定的目的是防止终端私自修改IP抢占地址。但如果你绑定的MAC地址不对或者终端换了网卡问题反而会出现终端上不了网ARP表状态异常。这时候不要光顾着改绑定应该先用display arp看当前实际学到的是什么确认终端真实MAC后再刷新绑定关系。7. 把状态查看变成顺手习惯日常巡检的节奏与记录7.1 巡检频率怎么定说实话没有哪台设备是必须天天查状态的但也不能等到故障发生了才想起来查。我自己根据设备角色不同会设定不同的巡检节奏核心路由器每周一次完整巡检分支/接入路由器每月一次基础巡检即可已知有隐患的设备每天或隔天看一次温度、CPU、内存机房环境恶劣高温、灰尘大夏天增加温度检查频率7.2 一个简单的巡检思路核心命令集中跑一遍登录设备后按顺序执行下面几条命令基本能覆盖全部需要关注的状态display version display device display cpu-usage display memory-usage display interface brief display ip interface brief display alarm active display logbuffer如果你管理的设备比较多完全可以把上面这些命令集成到一个脚本里。我在某些项目里用Python结合Paramiko库写过一个简单的巡检脚本自动SSH登录多台设备把输出保存到文本文件里再从中提取关键字段生成报告。实现上不算复杂思路就是依次连接设备、逐条下发命令、等待输出后保存。脚本本身不是重点重点是你可以把这个模式复制到自己环境里用任何你熟悉的方式——Shell结合expect、Python脚本、或者干脆手动复制粘贴都行。7.3 建立基线比单次查看更有价值单次查看状态只能看到当下这一刻的快照而真正的价值来自长期记录形成的基线。比如你现在看到设备温度55°C光看这个数字没法判断有没有问题但如果过去半年每次巡检记录的温度都在45°C上下今天突然跳到55°C你就能马上意识到散热出了问题。我自己习惯每次巡检后在本地表格里记录几个关键数值运行时间、CPU峰值、内存使用率、接口错误计数。别小看这个动作有一次我在对比上周和本周记录时发现某个接口的CRC错误从个位数涨到了几千虽然业务还没受明显影响但提前处理掉了隐患避免了一次中断。另外一定要养成备份配置的习惯。查看状态只能发现问题配置备份才是你手里的救命稻草。华为路由器上备份配置用Huawei display current-configuration比较稳妥的做法是把配置输出复制保存到本地文件按日期命名归档。每次做重大变更前也备份一次变更后如果出了状况直接对照或者恢复。结合我自己这些年摸设备的经验最后多说一句查看设备基本状态这件事技术含量可能不高但它决定了你在故障面前是先手还是后手。很多人喜欢研究复杂的高级配置反而忽略了最基础的状态查看。可正是这些基础命令在关键时刻帮你把故障范围从“整个网络”缩小到“一块网卡、一根网线、一个模块”。把上面这套操作练熟、固定成每日习惯遇到问题你就不会再手忙脚乱了。
返回列表