ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

中科曙光服务器培训教程:从PPT到上架验收的运维实战指南

中科曙光服务器培训教程:从PPT到上架验收的运维实战指南 简介这份中科曙光服务器培训教程汇总以《服务器基础知识》PPT为核心面向刚接触服务器硬件与运维的IT从业者、售前技术支持及高校相关专业学生帮助其建立从计算机原理到服务器分类的完整认知框架。资源包共1个pptx文件约42.47MB内容以图文并茂的幻灯片形式呈现便于课堂讲解与自学翻阅。教程从服务器与PC、工作站、小型机及各类计算机产品的对比切入系统梳理I/O性能、管理能力、可靠性与可扩展性等差异并展开塔式、机架式、刀片式等外形分类单路至多路CPU数分类以及按应用功能、服务规模、指令集架构CISC、RISC、EPIC的多维划分同时给出服务器性能评价的“5高”标准与曙光TC5600I G3、I620-G30等机型示例。已有601人学习适合作为服务器入门培训的参考课件帮助读者快速掌握服务器形态、硬件部件与软件构成的基础脉络。1. 中科曙光服务器培训教程汇总从一份 PPT 说起服务器基础知识到底该补哪些手里拿到一份《中科曙光服务器培训教程汇总服务器基础知识-v0.3.pptx》很多人第一反应是「又一份厂商宣讲材料」翻两页就丢进硬盘角落。但如果你真在机房待过、被半夜的告警电话叫醒过就会明白这类 PPT 的价值不在排版而在它把服务器这条产品线的知识骨架摊开了从机箱形态、主板架构、CPU 与内存子系统到 RAID、BMC 带外管理、电源与散热再到上架、加电、装系统、做阵列、配带外。它解决的不是「服务器是什么」这种科普问题而是「一台曙光服务器到手我该按什么顺序把它变成能跑业务的机器」。适合刚接手国产服务器运维的工程师、要带新人的老手以及做信创项目需要快速补齐硬件侧认知的开发者。下面我按这份教程的脉络把真正能落地的部分拆开讲。2. 先分清塔式、机架、刀片与液冷曙光服务器形态选型与上架前确认2.1 形态决定你后面所有操作的手感曙光的产品线里塔式如 I 系列入门机型适合办公室或小型机房单机部署噪音和功耗相对友好但扩展槽位和盘位有限机架式1U/2U/4U是数据中心主力2U 通常能塞下 8 到 12 个 3.5 寸盘位是存储与虚拟化混跑的甜点区刀片和高密度多节点机型走的是集中供电、集中散热路线机箱本身就是一套子系统换刀片不等于换整机。近两年热搜里「液冷服务器」出现频率很高曙光在这块有冷板式液冷整机柜方案冷板贴在 CPU、GPU 这些发热大户上靠循环冷液带走热量PUE 能压到 1.1 附近。选型时先问自己三个问题机房有没有标准 19 英寸机柜、供电是单路还是双路、未来一年盘位和 PCIe 槽位会不会不够。这三个答案基本就把形态锁死了。2.2 上架前必须核对的物理与供电清单上架不是把机器推进机柜拧螺丝就完事。先看导轨类型曙光的机架机型一般配免工具导轨但不同代次卡扣位置有差异装反了推不到底。再看深度2U 机型常见深度在 700mm 上下机柜内如果前面走了大量线缆可能顶到后门。供电这块双路电源要分别接到 A、B 两路 PDU别图省事插同一路否则一路跳闸整机下线。功耗按铭牌额定值乘 0.7 估算实际负载再留 20% 余量算 PDU 总容量。网口规划上带外管理口通常标 IPMI 或 MGMT和业务口物理分开管理口接独立管理网段别和业务 VLAN 混在一起后面做批量带外操作会省很多事。# 上架后先确认带外管理口能通假设管理口默认在 192.168.1.100 网段 ping -c 4 192.168.1.100 # 用 ipmitool 读取整机基础信息确认电源、风扇、温度传感器在线 ipmitool -I lanplus -H 192.168.1.100 -U admin -P 你的密码 sdr type temperature ipmitool -I lanplus -H 192.168.1.100 -U admin -P 你的密码 chassis status上面两条命令是加电后第一件事。sdr type temperature拉的是传感器数据记录能一眼看出进风口、CPU、内存各区域温度是否正常chassis status返回电源状态、上次关机原因、机箱入侵检测。参数里-I lanplus走的是 IPMI 2.0 带外通道-H跟管理口地址-U/-P是带外账号。如果 ping 不通先查管理口指示灯和交换机端口再确认管理口 IP 是不是被改过——曙光部分机型出厂管理口默认 DHCP没 DHCP 环境就得进 BIOS 或通过前面板小屏手动设。2.3 开箱后先做这三项硬件自检第一项看前面板健康灯和 BMC 日志有没有出厂运输导致的松动告警。第二项进 BIOS 确认 CPU 型号、内存容量与频率、盘位识别数量是否和订单一致尤其内存混插不同批次可能导致降频。第三项用曙光自带的诊断工具或通用工具跑一遍内存和磁盘 SMART 快检。这三步做完再装系统能避免装到一半发现少一条内存的尴尬。3. RAID 与磁盘阵列怎么做从 RAID 级别选择到曙光阵列卡实操3.1 RAID 0/1/5/6/10 在业务里的真实取舍热搜里「服务器磁盘阵列怎么做」是个高频问题。RAID 0 条带化性能最好但一块盘挂全盘数据没了只适合临时缓存盘。RAID 1 镜像两块盘互为备份容量减半适合装系统的小盘。RAID 5 用一块盘的校验空间换性能和容量的平衡三块起做允许坏一块但重建时如果另一块盘也有隐患就容易二次故障。RAID 6 双校验允许坏两块写性能比 5 差适合大容量近线存储。RAID 10 先镜像再条带性能与可靠性兼顾代价是容量利用率只有一半数据库这类随机写密集场景首选。曙光服务器常见配的是 LSI/Broadcom 系阵列卡或国产阵列卡管理界面大同小异关键是搞清楚卡上有没有缓存和超级电容——有缓存且带电池/电容保护时才能安全开启写缓存否则断电丢数据。3.2 用 storcli 在曙光服务器上建 RAID 5 的完整命令# 查看阵列卡与物理盘拓扑确认 Enclosure ID 和 Slot 编号 storcli /c0 show storcli /c0/eall/sall show # 用 0 到 3 号槽四块盘建 RAID 5指定写策略和条带大小 storcli /c0 add vd typeraid5 drives252:0-3 \ strip256 wb ra direct # 查看新建的虚拟盘状态确认 Optimal storcli /c0/vall showdrives252:0-3里的 252 是 Enclosure Device ID不同机型可能不同必须先用eall/sall show查出来再替换直接抄数字大概率翻车。strip256是条带大小单位 KB数据库类小 IO 多可以设 64 或 128大文件顺序读写设 256 或 512 更合适。wb是 Write Back 写回ra是 Read Ahead 预读direct表示 IO 直通不经过缓存策略的额外处理。建完务必用vall show看 State 是不是 Optimal如果是 Degraded 说明有盘没插紧或本身有问题。系统装好后再用smartctl -a /dev/sdX逐盘看 SMART重点看 Reallocated_Sector_Ct 和 Media_Error_Count 是否非零。3.3 阵列卡缓存与掉电保护的两个参数写缓存策略和掉电保护是绑定的。如果阵列卡没有超级电容或电池wb在断电时缓存里的数据就没了这种情况要么改wtWrite Through要么确保有 UPS。另一个参数是Direct与CachedIO 策略虚拟化场景通常用 Direct 减少一层缓存开销。改完策略不用重启但生效后建议跑一轮 fio 验证。# 用 fio 快速验证阵列随机读写注意别在业务盘上跑 fio --namerandread --ioenginelibaio --rwrandread --bs4k \ --numjobs4 --size2G --runtime60 --group_reporting \ --filename/dev/sdbbs4k模拟数据库随机读numjobs4起四个并发线程runtime60跑一分钟看 IOPS 和延迟。如果 IOPS 远低于预期先查阵列卡缓存策略再查盘本身是不是 SMR 盘——SMR 盘做 RAID 重建极慢这是很多人踩过的坑。4. 带外管理与系统部署BMC 配置、装系统与驱动注入4.1 BMC 网络配置与常用带外操作BMC曙光文档里常叫管理口或 IPMI是服务器的黑匣子系统挂了它还在。配置分两步先在 BIOS 或开机自检时进 BMC 设置改 IP或者用ipmitool通过本地接口改。管理网段建议独立 VLAN只允许运维跳板机访问别暴露到业务网。常用操作除了前面说的看传感器还有开关机、挂载虚拟光驱、看 SOL 串口日志。# 通过带外挂载 ISO 并设置下次从虚拟光驱启动 ipmitool -I lanplus -H 192.168.1.100 -U admin -P 密码 \ sol activate # 另开终端挂载 ISO ipmitool -I lanplus -H 192.168.1.100 -U admin -P 密码 \ chassis bootdev cdromsOL activate进串口重定向能看到 BIOS 和系统启动全过程装系统时排错全靠它。chassis bootdev cdrom把下次启动设备设为光驱配合虚拟光驱挂载 ISO 就能远程装系统。注意 SOL 会话里退出用~.直接关终端可能留下会话占用。4.2 装 Linux 时驱动与固件怎么处理曙光服务器装主流 Linux 发行版一般能直接识别阵列卡和网卡但较新机型配的国产网卡或新代次阵列卡可能需要在安装界面加载驱动。做法是去曙光支持网站下对应机型的驱动包解压后放到 U 盘安装时在引导菜单按 Tab 加inst.dd参数指向驱动。装完系统第一件事是更新 BMC 和 BIOS 固件固件更新走带外过程中绝对不能断电。第二件事是装厂商提供的管理代理用于带内采集硬件告警。第三件事是配好 NTP 时间同步热搜里「服务器时区」和「时间服务器」问得多集群里时间不同步会导致日志对不上、证书校验失败。# 配置 chrony 指向内网时间源 cat /etc/chrony.conf EOF server ntp.internal.example.com iburst EOF systemctl enable --now chronyd chronyc sources -viburst让首次同步更快chronyc sources -v看同步状态^*开头表示已同步。如果服务器在隔离网段没有时间源至少保证集群内一台做服务端其余指向它。4.3 系统盘与数据盘的分区习惯我一般把系统装在 RAID 1 的小容量 SSD 上数据盘单独做 RAID 5 或 10。分区上/boot给 1G/给 100G 到 200G剩下给/var或直接留空给业务。/var单独分是因为日志写满根分区是经典翻车场景。交换分区按内存大小内存大于 64G 时可以只给 16G 或更少甚至关闭但要在监控里盯紧内存。5. 避坑与排查曙光服务器运维里最容易翻车的五件事5.1 现象带外能 ping 通但 ipmitool 报认证失败原因通常是密码里有特殊字符被 shell 转义或者 BMC 固件版本对 IPMI 2.0 的加密套件支持有差异。解决把密码用单引号包起来或者改用-C 3指定加密套件仍不行就进 BMC Web 界面确认账号权限和是否开启了 IPMI over LAN。5.2 现象RAID 重建速度极慢业务 IO 被拖垮原因多半是用了 SMR 盘做 RAID或者重建速率被阵列卡限流。解决先storcli /c0 show rebuildrate看当前速率可以临时调高但业务高峰别调满长期方案是换 CMR 盘并把重建安排在低峰期。5.3 现象装完系统网卡不识别或只有百兆原因可能是驱动没装全或者网线接在了管理口上。解决lspci | grep -i eth看网卡是否被识别ethtool eth0看协商速率管理口和业务口外观接近看标签确认别插错。5.4 现象液冷机型告警漏液或冷板温度高原因可能是快接头没插到位或者冷液流量不足。解决先看 BMC 里漏液检测传感器状态再查冷板进出液温差温差过大说明流量不够联系机房侧检查 CDU。自己别乱拧快接头漏液腐蚀主板是大事。5.5 现象集群时间漂移导致日志时间错乱原因是没有统一时间源或 chrony 被防火墙挡了。解决确认 123/323 端口通chronyc tracking看偏移量偏移大先手动chronyc makestep跳一次再交给自动同步。6. 把这份 PPT 变成自己的检查清单一个可复用的验收脚本培训材料看完容易忘我的习惯是把关键检查点写成一个上架验收脚本新机器到手跑一遍输出一份报告存档。下面这个脚本覆盖带外连通、传感器、阵列、磁盘 SMART、时间同步五项你可以按自己环境改地址和账号。#!/bin/bash # 曙光服务器上架快速验收脚本需提前装好 ipmitool、storcli、smartmontools BMC_IP192.168.1.100 BMC_USERadmin BMC_PASS你的密码 REPORT/tmp/server_check_$(date %F).log exec (tee -a $REPORT) 21 echo 验收开始 $(date) echo ---- 1. 带外连通与电源状态 ---- ipmitool -I lanplus -H $BMC_IP -U $BMC_USER -P $BMC_PASS chassis status echo ---- 2. 温度传感器 ---- ipmitool -I lanplus -H $BMC_IP -U $BMC_USER -P $BMC_PASS sdr type temperature echo ---- 3. 阵列与虚拟盘状态 ---- storcli /c0/vall show | grep -E VD|State|Optimal|Degraded echo ---- 4. 物理盘 SMART 关键项 ---- for d in /dev/sd[a-z]; do [ -b $d ] || continue echo $d smartctl -H -A $d | grep -E SMART overall|Reallocated_Sector|Media_Error done echo ---- 5. 时间同步 ---- chronyc tracking | grep -E Reference ID|System time|Last offset echo 验收结束报告见 $REPORT 脚本里exec (tee -a $REPORT) 21把标准输出和错误同时打到屏幕和文件方便留档。storcli /c0/vall show过滤出虚拟盘状态重点看有没有 Degraded。SMART 那段只抓三个关键项SMART overall是健康自评后两个是重分配扇区和介质错误计数非零就要警惕。chrony 的Last offset反映最近一次同步偏差超过几十毫秒在集群里就值得查。这个脚本我一般放在跳板机的/opt/scripts/下新机器上架后第一件事就是 scp 过去跑一遍报告按机房和机柜号归档。血泪经验是别等业务上了才查硬件验收阶段多花二十分钟能省掉后面半夜爬起来换盘的后悔药。希望帮到你。本文还有配套的精品资源点击获取
返回列表