Folia
← 返回头版

GitHub 8月17日大规模服务中断

GitHub于8月17日遭遇长达7小时47分钟的服务中断1。此次事故影响范围广泛,github.com、用户认证、GitHub Actions、API、Pull Request、Issue和Copilot等核心服务均受波及1。

根据官方分析,服务中断的根本原因是位于Central US数据中心的关键基础设施组件未能随流量高峰而扩展,导致容量压力触发认证失败,进而引发整体服务中断1。值得注意的是,这是GitHub在8月内发生的第二次重大事故,两次事故均由容量失败引起,而非代码或配置变更所致1。

为应对业务增长压力,GitHub正在积极推进向Azure的基础设施迁移。截至事故发生时,Azure已承载GitHub平台负载的58%和一半的Git操作,相比5月的12%有显著提升1。与此同时,GitHub新增超过300万个CPU核心和120PB高速存储以扩展容量1。这些投入反映了平台流量的快速增长——从4月的14亿次commit增长到8月的29亿次1。


来源

  1. Hacker NewsThe August 17 outage

评论