1.
概述:运维要点与准备
操作前准备:确认控制台IP与实例ID;准备控制台远程串口/救援模式权限;本地安装ssh、mtr、iperf3、tcpdump等工具。建议先记录现状(ifconfig/ip a, lsblk, df -h, systemctl status)。
2.
SSH无法连接的排查与修复步骤
步骤:1) 本地尝试 ping 与 traceroute ip:ping -c 4 x.x.x.x; traceroute x.x.x.x。2) ssh 增强日志:ssh -vvv user@ip -p 22。3) 控制台查看安全组/防火墙是否放通22端口。4) 如控制台支持,进入救援模式并挂载系统盘:mount /dev/vda1 /mnt; chroot /mnt; 检查 /etc/ssh/sshd_config 与 /var/log/auth.log,重设root或用户密码:passwd username。5) 重启sshd:systemctl restart sshd。
3.
网络延迟与丢包定位
步骤:1) 使用 mtr 交互式定位丢包:mtr -rw ip。2) 使用 iperf3 测试带宽:在一端运行 iperf3 -s,在另一端运行 iperf3 -c server_ip -P 4。3) 抓包分析:tcpdump -i eth0 host X.X.X.X -w /root/cap.pcap,然后下载到本地用Wireshark分析。
4.
DNS解析问题修复流程
步骤:1) 本机查询:dig +short www.example.com @8.8.8.8 与 dig +trace。2) 检查 /etc/resolv.conf 与 systemd-resolved:systemd-resolve --status。3) 若使用自建DNS或私有网络,确认安全组/防火墙对53端口的放通。
5.
防火墙与安全组配置检查
步骤:1) 在控制台确认云安全组规则允许所需端口。2) 主机上检查iptables/ufw/firewalld:iptables -L -n; ufw status; firewall-cmd --list-all。3) 常用修复命令:ufw allow 22/tcp;firewall-cmd --permanent --add-port=80/tcp && firewall-cmd --reload;iptables -I INPUT -p tcp --dport 22 -j ACCEPT。
6.
磁盘识别、格式化与持久挂载
步骤:1) 查看磁盘:lsblk && fdisk -l。2) 新盘分区并格式化:fdisk /dev/sdb -> n -> w;mkfs.ext4 /dev/sdb1。3) 获取UUID并编辑 /etc/fstab:UUID=$(blkid -s UUID -o value /dev/sdb1);在 /etc/fstab 加入:UUID=... /data ext4 defaults 0 2;mount -a 验证。
7.
扩容与在线扩展文件系统
步骤:1) 若是云盘扩容后,使用 growpart /dev/vda 1(来自cloud-utils)扩展分区。2) 扩展文件系统:resize2fs /dev/vda1(ext4)或 xfs_growfs / -d(XFS)。3) 检查 df -h 与 lsblk 确认成功。
8.
快照备份与恢复操作流程
步骤:1) 在控制台创建快照(先停止写入或使用LVM快照)。2) 推荐在新实例上恢复快照验证:创建临时实例,挂载快照卷,检查数据一致性。3) 如需在故障中恢复,使用控制台“恢复为新卷并替换系统盘”的流程,重启并验证服务。
9.
时间同步与时区设置
步骤:1) 设置时区:timedatectl set-timezone Asia/Taipei。2) 启用NTP:systemctl enable --now chronyd 或 systemctl enable --now systemd-timesyncd。3) 验证:chronyc sources 或 timedatectl status。
10.
性能监控与日志排查实践
步骤:1) 常用工具:top/htop, iostat, vmstat, dstat。2) 部署监控:安装Prometheus节点导出器或Netdata以便长期监控。3) 日志查看:journalctl -u myservice -n 200;tail -F /var/log/syslog,结合日志时间定位故障。
11.
自动化与巡检脚本样例
示例脚本(bash)要点:检测SSH、HTTP、磁盘使用并报警。cron定时执行:*/5 * * * * /usr/local/bin/healthcheck.sh。脚本核心命令示例:ssh -o ConnectTimeout=5 user@localhost exit || echo "SSH down" | mail -s "alert" ops@example.com;df -h | awk '$5>80{print}'。
12.
安全加固建议与常规运维策略
建议:禁用密码登录仅允许密钥(/etc/ssh/sshd_config PermitRootLogin no, PasswordAuthentication no);启用fail2ban;定期apt/yum update并关注内核补丁;启用私有网络与备份策略并验证恢复。
13.
问:光算云在台湾节点适合部署生产业务吗?
回答:光算云台湾节点适合低延迟到台湾/东亚用户的生产部署,前提是评估网络稳定性、SLA与备份策略。应先做压力/带宽测试(iperf3、mtr)并启用多AZ或跨区备份。
14.
问:遇到实例无法开机如何紧急恢复?
回答:首先使用控制台快照或救援模式挂载系统盘,检查 /var/log/boot.log 与 journalctl;必要时在救援系统中修复 /etc/fstab 或grub,然后将修复后的卷重新挂载为系统盘并启动。
15.
问:如何联系技术支持与准备问题清单?
回答:联系光算云控制台工单或在线客服,提交工单前准备信息:实例ID、公网IP、最近操作时间、截图/抓包(mtr或tcpdump)、systemctl status与相关日志片段,能大幅提高处理效率。
来源:运维视角 台湾服务器光算云怎么样的常见问题与解决