GitHub sofre outage de 7h47 em 17 de agosto e promete acelerar melhorias
Plataforma enfrentou segundo incidente grave no mês; capacidade de infraestrutura não acompanhou demanda.
O que aconteceu
Em 17 de agosto, o GitHub sofreu uma queda que durou 7 horas e 47 minutos, interrompendo serviços críticos como github.com, autenticação, GitHub Actions, APIs, pull requests, issues e Copilot. Segundo a empresa, o incidente começou quando o tráfego atingiu um novo pico e um componente crítico da infraestrutura no data center da região Central dos EUA não conseguiu escalar. A pressão de capacidade se espalhou pelos sistemas, causando falhas de autenticação e afetando múltiplos serviços.
A recuperação exigiu ações coordenadas: equipes redirecionaram tráfego, isolaram infraestrutura afetada e restauraram serviços em etapas. A maioria dos serviços voltou no mesmo dia, mas alguns do Copilot demoraram mais, devido a um loop de tentativas no lado do cliente que aumentou o tráfego durante a recuperação. O GitHub afirma que a análise de causa raiz completa inclui um cronograma técnico detalhado.
Contexto
Este foi o segundo incidente significativo em agosto, após uma falha no Actions em 6 de agosto. Em março e abril, a empresa já havia compartilhado planos para melhorar a confiabilidade. A investigação apontou que nenhum dos dois apagões foi causado por mudança de código ou configuração — ambos foram falhas de capacidade. O GitHub não conseguiu escalar componentes críticos antes que a demanda excedesse a capacidade.
O crescimento da plataforma é notável: desde abril, os commits mensais saltaram de 1,4 bilhão para 2,9 bilhões, um aumento de 107%. Esse crescimento explica a pressão, mas, segundo a empresa, não justifica as quedas.
Por que importa
Para desenvolvedores e organizações que dependem do GitHub para entregar software, uma interrupção de quase 8 horas significa atrasos em deploys, integração contínua e colaboração. O impacto é global, afetando equipes em todos os fusos, incluindo o Brasil, onde o GitHub é amplamente usado em empresas e projetos open source. A confiabilidade da plataforma é crítica para o fluxo de trabalho moderno de desenvolvimento.
Impacto
No curto prazo, a queda gerou frustração e perda de produtividade. No médio prazo, o GitHub precisa demonstrar que as melhorias estruturais evitam novos incidentes. A empresa já adicionou mais de 3 milhões de núcleos de CPU, 120 petabytes de armazenamento de alta velocidade e capacidade de rede significativa. Além disso, acelerou a migração para Azure, que hoje responde por cerca de 58% da carga da plataforma e metade das operações Git, contra 12% em maio.
O que muda
A estratégia do GitHub inclui três prioridades: adicionar capacidade, melhorar eficiência e remover gargalos arquitetônicos. A expansão da infraestrutura no Azure também apoia o escalonamento de monorepos de grande porte. A empresa afirma que os incidentes deixam claro que é preciso acelerar esse trabalho.
O que vem agora
O GitHub promete continuar investindo em capacidade e migração para Azure, além de revisar os processos de escalonamento. A empresa deve publicar a análise de causa raiz completa, com detalhes técnicos, para que a comunidade entenda as falhas e as correções. A expectativa é que novas medidas de resiliência sejam implementadas nos próximos meses.
