8月17日宕机事件与未来工作

Hacker News Top 新闻

摘要

GitHub 在8月17日因容量故障遭遇重大宕机,导致服务中断数小时。公司正在加快努力,以提升基础设施可靠性并扩展系统以应对增长。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/20 22:17

# 8月17日故障及后续工作 来源:https://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/ 8月17日,GitHub遭遇了一次持续7小时47分钟的宕机事故。此次故障影响了github.com、身份认证、GitHub Actions、API、拉取请求、议题以及Copilot服务,波及全球众多开发者与组织。如果您在当日尝试发布软件,我们辜负了您的信任。 这是我们继8月6日Actions服务故障(https://www.githubstatus.com/incidents/qcvjkzcs7j74)后,在八月份发生的第二起重大事故。今年三月(https://github.blog/news-insights/company-news/addressing-githubs-recent-availability-issues-2/)和四月(https://github.blog/news-insights/company-news/an-update-on-github-availability/),我曾介绍过团队正在开展的提升GitHub可靠性的工作。尽管已取得进展,但本次事故明确表明我们必须加快这一进程。 ## 事故始末 经调查发现,事故始于流量达到新高峰时,我们在美国中部数据中心的一个关键基础设施组件未能随之扩展容量。由此产生的系统压力波及多个服务,导致认证失效并中断了多项GitHub功能。 恢复过程需要多方协同:团队重新引导流量、隔离受影响的基础设施,并分阶段恢复服务。大部分GitHub服务在当天较早时段已恢复,但部分Copilot服务耗时更长。这些服务的错误触发了客户端重试循环,在恢复期间进一步增加了流量压力。我们不得不先缓解这种行为,才能安全地恢复流量。完整的根本原因分析报告(https://www.githubstatus.com/incidents/zkxwbgr0cnmx)包含详细的技术时间线。 两次故障均非由代码或配置变更引起,本质上都是容量瓶颈问题。我们未能在需求超过临界组件承载能力前完成扩容。自四月以来,月度提交量已从14亿增长至29亿。这种增长给系统带来了压力,但这不能成为事故的借口。 三张并排的深色主题折线图显示2023至2026年的强劲增长:月度合并拉取请求量升至约1.3亿,月度提交量达约29亿,新建仓库数增至约2400万,2025-2026年呈现加速增长趋势。 ## 当前进展与未来规划 作为今年初可靠性承诺的一部分,我们聚焦三大优先事项:增加容量、提升效率、消除架构瓶颈。为此我们已新增超过300万个CPU核心、120PB高速存储及大量网络容量。在加速迁移至Azure的同时,我们已在现有数据中心部署了所有可用电力支持的硬件设备。 目前Azure承载着GitHub平台约58%的负载和半数Git操作,而五月份该比例仅为12%。这一扩展的基础设施也支撑了GitHub Actions任务运行量的增长。 题为“GitHub Actions完成运行量增长”的大型深色折线图显示,从2026年初到八月,每周规律性波动中呈现持续上升趋势,数值从年初约1500-3000万增长至超过1亿,最终达到约1.154亿。 Azure的基础设施与容量优势,也加速了我们扩展超大规模代码库的进程。我们的下一个里程碑是实现读取容量与读取者数量线性扩展的架构,支持无限制的读取操作。该架构将从最大型的代码库开始逐步推出。 两张“获取吞吐量历史”深色主题图表,在短时间窗口内对比了每秒获取操作量。左图在~1000 OPS/S附近波动并趋于平稳,尾段出现下降;右图则呈阶梯式稳步攀升至约1800 OPS/S。 规模扩张并非我们面临的唯一挑战。随着变更节奏与复杂度的提升,现有运维实践未能同步进化。我们已重组团队与资源,聚焦可用性建设,并加强了测试体系、发布流程优化、可观测性建设和告警机制。虽已取得进展,但这项工作尚未完成。 此外,我们正在隔离关键系统并移除其间的共享依赖。这项举措旨在降低故障发生概率,并在事故出现时控制其影响范围。 我们从每次故障中吸取教训,并将新增任务纳入可用性工作流。8月6日和17日的事故促使两项即时改进:第一,我们将在服务间交互中统一实施重试限制、重试预算和可变超时策略,防止重试风暴与级联负载;第二,我们正在评估低优先级CPU与内存告警,识别可能在流量峰值期间失效的组件。 对高可用性的承诺不仅是技术层面的宣言。开发者社区依赖GitHub来构建、发布和运维他们的工作。这要求我们值得信赖,而8月17日我们未能做到。修正这一点是我们的责任。我们将通过提升平台的规模与可靠性来重新赢得您的信任。 ## 作者 Vlad Fedorov Vladimir Fedorov是GitHub首席技术官,拥有数十年工程领导与创新经验。作为开发者生产力的坚定倡导者,Vlad正带领GitHub工程团队以开发者优先的理念塑造开发者工具与创新的未来。 加入GitHub前,Vlad联合创办了专注于数据治理与隐私的初创公司UserClouds。他在Facebook(现Meta)任职12年,担任高级副总裁,领导超过2000人的工程团队负责隐私、广告和平台业务。职业生涯早期,Vlad曾在微软工作,并在加州理工学院获得计算机科学学士与硕士学位。目前他担任Codepath.org董事会成员,该机构致力于重构高等教育体系,培养首批原生人工智能时代的工程师、技术主管和创始人。 Vlad居住在湾区,工作之余喜欢与家人在户外和水上共度时光。 ## 相关文章 ## 探索更多GitHub内容 文档 ### 文档 一站式掌握GitHub所有必备知识。 前往文档库 (https://docs.github.com/) GitHub ### GitHub 在GitHub上构建未来,这里是全球任何人构建任何项目的起点。 开始构建 (https://github.com/) 客户案例 ### 客户案例 了解使用GitHub构建产品的企业与工程团队。 了解更多 (https://github.com/customer-stories) GitHub Universe 2026 ### GitHub Universe 2026 10月28-29日,加入我们旧金山现场或线上举办的GitHub Universe旗舰开发者大会,汇聚开发者、智能体与全球代码。 立即注册 (https://githubuniverse.com/?utm_source=Blog&utm_medium=GitHub&utm_campaign=module_uni_26)

相似文章

GitHub 正在经历服务问题

Hacker News Top

GitHub 正在经历一次大规模中断,影响多项服务,包括 GitHub Actions、Pages、Copilot 和 Enterprise Importer,导致工作流失败和延迟。工程师正在积极采取缓解措施。

GitHub.com 服务异常事件

Hacker News Top

GitHub 正经历多项服务(包括 Web、API、Git 操作、Webhooks 和 Copilot)的高错误率和性能下降问题,相关团队正在进行调查与缓解处理。