1. 概述与准备
- 目的:在台湾数据中心对机箱式服务器及云服务器进行系统化故障排查与恢复,尽量缩短故障恢复时间。
- 准备:确认工单、机柜编号、服务器标签、远程控制账号(IPMI/iDRAC/iLO)、交换机端口信息、备份位置与快照时间点。
- 工具:笔记本(带串口/USB转串口)、网线、标签、静电手环、十字/一字螺丝刀、替换硬盘与电源模块。
2. 第一步:现场安全与通告
- 1) 通知相关人员:运维团队、值班工程师与客户,说明维护时间与可能影响的服务。
- 2) 断电/带电操作判定:确认是否允许热拔插或需停机;若需断电则按SOP逐台关闭并记录。
- 3) 人身与设备安全:佩戴防静电手环,禁止在无接地条件下拆卸电源或插拔敏感部件。
3. 机箱硬件外观与指示灯检查
- 1) 外观检查:检查机箱外壳、舱门、风扇网是否有异物卡滞,机架螺丝是否松动。
- 2) 指示灯判读:记录电源指示灯(PSU)、风扇警告灯、系统状态灯(SYS_FAIL)与硬盘灯(HDD)状态。拍照留证。
- 3) 物理重插:对松动的模块(内存、网卡、HBA)在断电/允许热插拔的前提下按规范重插并重新测试。
4. 使用远程管理(IPMI/iDRAC/iLO)进行初步诊断
- 1) 登录:通过Web或IPMItool登录远程管理界面,检查系统日志(SEL)、传感器温度、电源与风扇状态。
- 2) KVM与Serial-over-LAN:启用远程KVM或SOL查看BIOS自检(POST)输出,判断是否卡在BIOS或引导阶段。
- 3) 强制重启与日志采集:若系统无响应,可使用远程重启或进入救援模式,同时抓取内核日志、dmesg及SEL导出以便分析。
5. 网络层排查(从物理到逻辑)
- 1) 物理链路:检查网线、光模块、交换机端口指示灯,若端口不活动,尝试更换端口或直连交换机排查。
- 2) 交换机配置:核对交换机VLAN配置、端口速率与双工设置,查看有无端口安全或MAC限制导致被封锁。
- 3) 主机内网络诊断:在主机或通过控制台执行 ip addr / ip link / ethtool 查看链路;用 ping/arp/route/traceroute 确认连通性;必要时抓包(tcpdump)定位流量问题。
6. 存储与RAID排查与恢复
- 1) 识别故障盘:通过RAID管理工具(megacli、storcli、hpacucli)查看阵列状态,记录RAID级别、降盘信息与重建进度。
- 2) 热拔与替换:确认硬盘为热插拔后,按照标签标注位置拔出故障盘并插入新盘,监控控制器开始自动重建。
- 3) 人工重建与数据恢复:若自动重建失败,使用备份快照或校验盘做手动重建/重同步;重要数据需优先做块级镜像(dd或更专业工具)后再操作。
7. 问:云服务器(VM)不可达,先做哪些快速判断?
- 1) 先在云管理控制台查看VM状态(Running、Stopped、Error)。
- 2) 尝试控制台登录(serial console)查看内核/登录提示;若控制台可达但网络不可达,问题在网络层或防火墙。
- 3) 如管理控制台显示宿主机问题,考虑迁移或重建实例并从快照恢复。
8. 答:对于云服务器不可达的推荐恢复步骤
- 1) 不可达但VM状态正常:通过虚拟控制台登录,重启网络服务(systemctl restart network 或 /etc/init.d/network restart),检查iptables/ufw规则。
- 2) VM处于异常或宿主问题:在云平台上先创建快照,尝试从快照启动临时实例或挂载磁盘到救援实例检查文件系统与配置。
- 3) 若是宿主硬件故障,使用云平台提供的迁移/恢复工具,将磁盘迁移到健康宿主或由平台团队进行物理修复。
9. 问:物理硬盘确认故障后如何安全替换并确保数据一致?
- 1) 确认故障盘编号与RAID信息并拍照、记录。
- 2) 在确保阵列支持热插拔的前提下进行物理替换,避免同时替换多盘造成数据丢失。
10. 答:硬盘替换与数据校验的详细步骤
- 1) 备份:优先在替换前做快照或块级备份(dd、storage snapshot)。
- 2) 更换步骤:把故障盘标记并从柜中拔出,插入同型号或兼容新盘,观察RAID控制器开始重建。
- 3) 重建后校验:使用fsck、mdadm --detail --scan或RAID工具校验一致性,运行应用层数据完整性检查(校验和、应用自检)。
11. 问:网络故障排查建议的命令与顺序是什么?
- 1) 局部连通性:ping 本机环回、网关、上层交换机。
- 2) 路由/链路:ip route / route -n / ip link / ethtool 查看接口与路由。
- 3) 抓包与应用层:tcpdump 捕获疑似问题流量,netstat -tunlp 查看端口占用。
12. 答:常用命令与排查流程模板
- 1) 基础检查:ip addr show;ip link show;ethtool ethX(查看速率与双工);dmesg | grep eth(查看驱动错误)。
- 2) 连通与路径:ping <目标>;traceroute <目标>;arp -a;route -n。
- 3) 抓包与分析:tcpdump -i ethX host
-w /tmp/cap.pcap;使用Wireshark/分析器查看重传、RST或ARP风暴等异常。
- 4) 恢复建议:短时间内无法定位时,先流量切换至备用链路或将实例放入维护模式并从快照恢复以保证业务可用性;故障结束后做事后总结(Root Cause Analysis)并更新SOP。
来源:数据中心维护 台湾服务器机箱云服务器故障排查与恢复流程