谷歌云因维护失误遭遇4小时服务中断
2026年9月5日,谷歌云公司报告了一起因维护操作不当导致的重大服务故障。在数据中心进行路由器扩容时,一名工程师错误地切断了所有光纤连接,导致部分云资源断开与外部网络的联系。故障时间从9月1日07:41持续至11:52,共计4小时11分钟。这次事件主要影响了位于美国艾奥瓦州us-central1-b可用区的部分资源,其他同一区域的可用区并未受到影响。
事件发生时,工程师正按照预定计划对数据中心内的路由器进行扩容,这些路由器承载着us-central1-b区的一些计算资源。谷歌的数据中心网络依赖于多个路由设备,这些设备和光纤连接在物理上相互隔离,且电源供给来源也不同。根据网络设计,即使单个设备或光纤链路出现问题,客户的流量通常不会受到影响,甚至在发生两到三处故障的情况下,网络依然能够正常运行。然而,在此次维护中,工程师在短短13分钟内相继拔掉了所有光纤连接,包括冗余链路,造成全面断网。谷歌方面表示,未能及时将相关警告传达到工程师,导致了这一失误的发生。
在故障期间,用户无法从外部访问受影响的虚拟机,这些虚拟机也无法连接到所在可用区以外的任何资源。此次故障还对多个云服务产生了影响,包括容器、应用托管、数据库以及网络与数据分析服务。Google Kubernetes Engine的部分集群和节点无法访问;Cloud Run和App Engine服务出现请求延迟升高,部分请求被迫中止;Cloud SQL数据库服务的某些实例连接中断。其中,BigQuery、虚拟专用云(VPC)等产品也向用户报告了丢包、连接中断或API请求超时等问题。
在故障发生后,谷歌的自动网络监控及主动探测系统立即检测到了异常,网络工程师及事故响应团队迅速介入,将流量从受影响的基础设施转移。可以自动切换的流量被重新导向同一区域内的正常资源。与此同时,现场技术人员也着手寻找被拔掉的光纤并进行重新连接。在链路恢复、网络流量恢复正常后,工程团队将流量重新切回,逐步恢复相关服务。最终在09:19,谷歌宣布底层网络已恢复正常,然而部分应用的恢复仍需时日。Cloud Run与App Engine的某些服务直到11:52才能完全恢复正常运行。
星期日-星期五||8:00-7:00
13594780067