GitHub.com Enfrenta Incidente de Quase Oito Horas com Múltiplos Serviços Afetados
Aprofundamento CEVIU
Aprofundamento
Este incidente revela a complexidade da orquestração de sistemas distribuídos. A exaustão da concorrência de um sidecar Istio, combinado com uma política de autoscaling que não considerava os limites do sidecar, gerou um gargalo crítico. A falha se espalhou para os nós HAProxy, sobrecarregando-os e degradando o caminho de autenticação. A situação escalou devido a um bug de retry no VS Code, que transformou falhas no serviço Copilot em um
O que mudou
Por que isso importa
Para engenheiros de plataforma e times de DevOps, este incidente oferece um estudo de caso valioso sobre resiliência em arquiteturas distribuídas. Ele destaca como a interação entre service meshes (Istio), balanceadores de carga (HAProxy) e o comportamento de clientes (VS Code) pode criar falhas em cascata. É um lembrete vívido da importância de uma configuração granular, da otimização de políticas de autoscaling e da análise de impacto de lógicas de retry.
Além disso, o evento reforça o desafio contínuo do GitHub em escalar sua infraestrutura para atender ao aumento do tráfego gerado por agentes de IA, um tema que abordamos em matérias de abril e março de 2026. A plataforma precisa de estratégias robustas para lidar com picos de demanda imprevisíveis e manter a estabilidade.
Linha do tempo
GitHub Aborda as Recentes Indisponibilidades e Detalha Plano de Recuperação
O GitHub ainda merece o status de "principal plataforma Git para desenvolvimento IA-nativo"?
GitHub aborda recentes problemas de disponibilidade
Atualização sobre a Disponibilidade do GitHub
GitHub Actions Enfrenta Falha Histórica e Expõe Limites de Escalabilidade
GitHub enfrenta interrupção global e impacta desenvolvedores
GitHub.com Enfrenta Incidente de Quase Oito Horas com Múltiplos Serviços Afetados
Perguntas frequentes
O que é um Istio sidecar e como ele causou a falha inicial?
Um Istio sidecar é um proxy que roda ao lado de cada serviço em um service mesh, controlando o tráfego de rede. Neste incidente, o sidecar atingiu seu limite de concorrência e não escalou automaticamente por causa de uma política de autoscaling mal configurada, tornando-se um ponto de falha e desencadeando a cadeia de problemas.
Qual foi o papel do HAProxy na indisponibilidade do GitHub?
HAProxy é um balanceador de carga que distribui requisições entre servidores. No incidente, os nós HAProxy foram sobrecarregados pela falha do Istio e pela amplificação do tráfego. Isso esgotou seus limites de fluxo, degradando a autenticação e causando indisponibilidade generalizada para vários serviços.
O que é um "retry storm" e como ele piorou a situação?
Um "retry storm" ocorre quando múltiplos clientes tentam se reconectar ou repetir requisições a um serviço já em falha, amplificando massivamente o tráfego e sobrecarregando ainda mais o sistema. Um bug de retry no VS Code multiplicou em 10 vezes o tráfego do Copilot, atrasando a recuperação do serviço.
Como a IA se conecta aos problemas de escalabilidade do GitHub?
Conforme o CEVIU News já noticiou em abril e março de 2026, o aumento massivo do tráfego gerado por agentes de codificação de IA tem sobrecarregado a infraestrutura do GitHub. Este incidente recente mostra que a plataforma ainda enfrenta desafios significativos para escalar eficientemente e manter a estabilidade diante dessa demanda crescente e imprevisível.
Fontes
- githubstatus.comfonte original
- Categoria
- CEVIU DevOps
- Publicado
- 19 de agosto de 2026
- Editoria
- CEVIU DevOps

