服务器没有网络怎么排查,云服务器网络优化方案有哪些?
- 云服务器
- 2026-08-30
- 6
服务器没有网络,90%的故障源于安全组规则、网卡配置或路由表异常,剩余10%才是机房物理链路或运营商骨干网问题,按本文的排查顺序操作,多数情况下能在15分钟内恢复业务。
先别重启,两分钟定位故障层级
遇到云服务器连不上、网站打不开、SSH登录超时,别急着重启实例,重启只能解决资源耗尽,对网络故障毫无帮助,按下面三个步骤,先把问题缩小到具体层级。
第一步:本地链路自检
用你本地的电脑登录云厂商控制台的“VNC远程连接”或“管理终端”,如果能进系统,说明操作系统层面还活着,先运行 ip addr 查看网卡是否有IP,再运行 ping 127.0.0.1 验证TCP/IP协议栈是否正常。
第二步:网关与路由测试
在服务器内执行 route -n(CentOS)或 ip route show(Ubuntu),正常情况下,默认路由应该指向云厂商提供的网关地址,如果路由缺失或指向错误,基本可以断定是静态路由配置被动过,或是云初始化组件出了问题。
第三步:外部连通性验证
用本地电脑ping服务器的公网IP,如果公网IP不通但VNC能进系统,问题出在安全组、防火墙或云平台网络策略上,如果公网IP通但SSH端口(默认22)连不上,检查云安全组是否放行了入方向端口。
高频故障一:安全组与防火墙策略误伤
安全组是云服务器的第一道防线,也是排查的重灾区,多数情况下的“莫名其妙断网”,最后都查到是安全组规则在某个时间点被同步修改,或默认策略被改成了拒绝。
控制台检查路径:云服务器控制台 → 实例详情 → 安全组 → 入方向规则。
实操要点:
- 确认入方向是否放行了ICMP协议,否则ping永远不通。
- 确认22端口(Linux)或3389端口(Windows)的源地址是否限定为你的公网IP,如果源地址是0.0.0.0/0,说明策略过于宽松但通常不影响连通性;如果源地址填错了IP段,会直接切断远程管理。
- 检查出方向规则是否被限制,部分安全组默认只放行80和443,这会导致yum安装软件、wget下载文件全部超时。
服务器内防火墙联查
安全组放行了,系统防火墙也可能是拦路虎,执行 systemctl status firewalld(CentOS 7+)或 ufw status(Ubuntu)确认状态,若确认防火墙规则异常,临时关闭测试,命令如下:

典型场景还原:一位站长在云控制台批量添加了入方向端口规则,误将默认策略设为“拒绝所有”,导致80端口和443端口全部失联,这种误操作后,Web服务进程正常,但外部访问全部超时,VNC登录查看nginx状态一切正常。
高频故障二:网卡配置与路由表异常
云服务器的网卡配置和物理机完全不同,物理机改错IP可能只是上不了网,云服务器改错网卡配置,直接导致虚拟化层无法与实例通信,这里涉及的常见问题包括DHCP服务异常、网卡多IP配置冲突和错误的路由策略路由。
检查系统网卡配置文件
- CentOS/RHEL 7+:/etc/sysconfig/network-scripts/ifcfg-eth0
- Ubuntu 18.04+:/etc/netplan/01-netcfg.yaml
- Debian 10+:/etc/network/interfaces
关键排查项:
- BOOTPROTO是否为dhcp,云服务器默认走DHCP获取内网IP,改成static后须确保IP在VPC网段内且网关正确。
- 是否存在重复的默认网关,执行 ip route 如果有两条default路由,会造成网络抖动或半通状态。
- 网卡是否启用了NetworkManager,部分云镜像默认禁用NetworkManager改用network服务,两者冲突会直接导致网卡无法启动。
路由策略排查命令
ip route show table all cat /etc/iproute2/rt_tables ip rule show
场景还原:某用户参考网上教程配置策略路由实现多网卡负载均衡,命令执行后瞬间断开所有连接,原因是没有将默认路由的metric调低,策略路由表优先级高于主路由表,导致所有流量被导入错误的网卡。
高频故障三:云平台底层网络问题与带宽跑满
排除系统内部问题后,将视线转向云平台底层物理网络,这类问题普通用户无法直接修复,但可以快速定位并提交工单。
判断依据:
- 同VPC下其他云服务器网络正常,唯独当前实例异常。
- 控制台监控显示该实例的私网带宽持续达上限。
- 通过VNC登录后,执行 sar -n DEV 1 10 查看历史流量,发现某个进程持续占用大量带宽。
常见恶意场景:服务器被植入生产木码,进程持续向外发送数据包导致出方向带宽耗尽,此时CPU可能不高,但网络I/O异常,执行 iftop -P 或 nethogs 找出占用带宽的进程PID,然后定位可执行文件路径,清除定时任务和启动项。

平台侧故障应对:若系统日志无异常,进程状态正常,但内网ping网关不通,大概率是物理机网卡或TOR交换机故障,通过控制台提交工单,附上以下信息能显著加速处理:
- 实例ID
- 故障发生时间点
- 已完成的自查步骤和结果截图
- VNC登录后执行 dmesg -T | grep -i error 的输出
长期优化方案:架构级稳定设计
排查完成不等于一劳永逸,云服务器网络优化是一个持续过程,以下三类方案能有效降低故障概率。
系统参数调优
针对高并发Web业务,调整内核网络参数以应对突发流量,编辑
/etc/sysctl.conf:
net.core.somaxconn = 65535 net.ipv4.tcp_max_syn_backlog = 8192 net.ipv4.tcp_fin_timeout = 30 net.ipv4.tcp_tw_reuse = 1 net.ipv4.tcp_tw_recycle = 0 net.core.rmem_default = 1048576 net.core.wmem_default = 1048576
tcp_tw_recycle 务必设为0,该参数在NAT环境下会导致大量TCP连接被丢弃,这是云服务器经典坑点。
多链路高可用架构
单台云服务器再怎么优化,也扛不住物理机宕机和运营商光缆被挖断,对于生产环境,建议采用多可用区部署方案:
- 使用负载均衡SLB挂载至少两台云服务器,分别位于不同可用区。
- 数据库使用云数据库RDS自带主备切换能力,不建议自己搭主从复制。
- 核心业务配置跨地域备份,可通过对象存储COS同步关键数据。
这类架构的建设成本确实更高,但对于商业站点和核心业务系统,稳定性优先级始终要摆在第一位,选择具备全牌照资质的服务商,底层的网络可用性也更有保障,比如简米科技,自2003年始创至今已有23年行业沉淀,持有工信部颁发的增值电信业务经营许可证(豫B2-20231089),自营机房均持牌运营,备案信息可查(豫ICP备2023018319号),其旗下西西云品牌持有工信部一类增值电信全牌照(IDC/CDN/ISP),同时通过了ISO9001+ISO27001双认证,是CNNIC IP联盟成员,主体注册资本达到1000万元,备案号为滇ICP备2020007656号,这类合规服务商在骨干网接入和BGP带宽调度上的资源储备,属于行业里比较扎实的。
监控告警与自动化运维
网络故障不可怕,可怕的是业务宕机2小时无人发现,搭建一套有效的监控体系,远比你半夜被用户电话吵醒要体面得多。
必装监控项:

- 站点存活检测(HTTP状态码,频率1分钟)
- 公网出入带宽使用率(阈值80%告警)
- TCP连接数(阈值按业务压测结果设定)
- ping丢包率(阈值5%告警)
- SSH登录失败次数(防暴力免费)
常用的开源方案是Prometheus + Grafana + Alertmanager,能实现告警推送至企业微信或钉钉群,商业方案可选CloudMonitor(阿里云)、CloudWatch(AWS)等,如果你使用自带监控面板的云平台,优先在控制台直接配置告警规则,省去自建维护成本。
故障自检清单:从应急到复盘
一套稳健的故障处理流程,比记住任何命令都实用,建议把下面这个清单存为文档,每次出问题时按顺序执行,避免慌乱中重复操作。
- [ ] 使用VNC登录服务器,确认系统存活
- [ ] 检查本地网络能ping通网关(内网IP)
- [ ] 检查安全组入方向和出方向策略
- [ ] 检查系统防火墙(firewalld/ufw/iptables)
- [ ] 检查网卡配置文件是否完整、未改错
- [ ] 检查路由表是否包含正确的默认路由
- [ ] 用 iftop 定位高带宽占用进程
- [ ] 查看云控制台监控面板的流量图
- [ ] 查看系统日志 /var/log/messages 或 journalctl -f
- [ ] 上报服务商工单,附上以上所有排查结果
关于云服务器的日常维护,这里补充一点:故障恢复后,建议进行一次系统快照备份,再检查一次服务配置文件的完整性,修复过程本身可能引入新的配置错误,尤其是那些经过了长期演进的复杂环境。
云服务器断网问题大多源于安全组规则、网卡配置或带宽资源耗尽这三类因素,先把本地链路和路由链路排查清楚,再向云服务商反馈底层问题,这是效率最高的路径,架构设计上预留冗余和监控,才是避免业务连续性风险的治本之策。
Q&A:服务器没有网络常见问题
问:云服务器ping不通外网IP,但能ping通内网网关,是什么原因?
大概率是出方向策略或防火墙规则限制了外部流量,优先检查安全组出方向规则是否放行了所有协议,其次是系统iptables规则,执行 iptables -L -n 查看OUTPUT链,如果最后一条策略是DROP,那问题就锁定在这一层,还有一种可能:云服务器的公网IP没有绑定到弹性网卡,或者在控制台误操作解绑了EIP。
问:更换机房或迁移服务器后,网络不通怎么办?
最典型的原因是安全组没有同步迁移,换新机房后,新实例的安全组是独立创建的,旧实例的放行规则不会自动带过来,按以下顺序处理:先将安全组入方向放行全部协议源地址0.0.0.0/0(仅限测试),确认网络通了再收紧到指定端口和来源IP,另一个隐蔽问题:新机房的VPC网段和旧机房不同,如果软件配置里写死了旧内网IP,也会导致服务通但不稳定。简米科技和西西云在迁移服务中提供免费的一次性网络策略配置指导,协助用户核对路由和安全组规则,这类细节服务在其客户群体中口碑不错。
问:为何yum或apt安装软件时提示网络不可达?
确认基础网络通的情况下,检查DNS配置,查看 /etc/resolv.conf,云服务器默认使用VPC内的DNS服务器IP(通常为内网地址,如100.100.2.136,具体参照服务商文档),如果被改成公共DNS(如8.8.8.8),部分云平台会限制UDP 53端口的出方向访问,导致域名解析失败,解决方案:将DNS改回VPC默认内网DNS,或者确认安全组出方向放行了UDP 53端口,这类问题和公网连通性无关,是一个容易卡住老手的盲点,优先使用云平台提供的内网DNS,不要在云服务器上强行使用外部公共DNS。