GitHub : pourquoi la panne géante du 17 août ?

Par:
francoistonic

lun, 24/08/2026 - 08:18

Si GitHub n'a pas communiqué sur les causes de la panne géante le jour même, l'éditeur a publié un début d'explication le 20 août par l'intermédiaire de Vlad Fedorov. La panne a touché de nombreux services GitHub durant presque 8h. Ce qui a impacté de millions d'utilisateurs et d'entreprises. Surtout, il s'agissait de la 2e grosse panne du mois après cette du 6 août, de mars et d'avril. Cela commence à faire beaucoup...

"Notre enquête a révélé que la panne a débuté lorsque le trafic a atteint un nouveau pic et qu'un composant d'infrastructure critique de notre datacenter du centre des États-Unis n'a pas pu suivre cette augmentation. La surcharge qui en a résulté s'est propagée à l'ensemble de nos systèmes, provoquant des échecs d'authentification et perturbant plusieurs services GitHub.
Le rétablissement a nécessité plusieurs actions coordonnées. Les équipes ont redirigé le trafic, isolé l'infrastructure affectée et rétabli les services par étapes. La plupart des services GitHub ont été rétablis plus tôt dans la journée, mais certains services Copilot ont mis plus de temps. Des erreurs dans ces services ont déclenché une boucle de nouvelles tentatives côté client, ce qui a accru le trafic pendant la récupération. Nous avons dû atténuer ce comportement avant de pouvoir rétablir le trafic en toute sécurité. L'analyse complète des causes profondes comprend une chronologie technique détaillée.
Aucune des deux pannes n'a été causée par une modification du code ou de la configuration. Les deux incidents étaient dus à des défaillances de capacité. Nous n'avons pas pu adapter la capacité des composants critiques avant que la demande ne la dépasse. Depuis avril, le nombre de commits mensuels est passé de 1,4 milliard à 2,9 milliards. Cette croissance explique la pression exercée sur nos systèmes, mais n'excuse en rien ces pannes." explique Vlad. 
GitHub veut agir pour prévenir une nouvelle panne de ce genre. "Dans le cadre des engagements de fiabilité pris en début d'année, nous nous sommes concentrés sur trois priorités : l'augmentation de la capacité, l'amélioration de l'efficacité et la suppression des goulots d'étranglement architecturaux. Nous avons ainsi ajouté plus de 3 millions de cœurs de processeur, 120 pétaoctets de stockage haute vitesse et une capacité réseau considérable. Nous avons installé autant de matériel que la puissance disponible le permettait dans nos centres de données existants, tout en accélérant notre migration vers Azure.
Aujourd'hui, Azure prend en charge environ 58 % de la charge de la plateforme GitHub et la moitié des opérations Git, contre 12 % en mai. Cette empreinte étendue a également soutenu la croissance du nombre d'exécutions de tâches GitHub Actions, illustrée ci-dessous." poursuit l'éditeur. 
En conclusion : "De plus, nous isolons les systèmes critiques et supprimons les dépendances partagées entre eux. Ce travail vise à réduire la probabilité d'une panne et à en limiter l'impact lorsqu'elle survient.
Nous tirons des enseignements de chaque panne et intégrons de nouvelles actions à notre flux de travail sur la disponibilité. Les incidents des 6 et 17 août ont entraîné deux changements immédiats. Premièrement, nous appliquons des limites de tentatives de connexion, des budgets de tentatives et des délais d'attente variables uniformes pour toutes les interactions entre services afin d'éviter les surcharges et les pics de charge. Deuxièmement, nous examinons les alertes de faible priorité concernant le processeur et la mémoire afin d'identifier les composants susceptibles de tomber en panne lors de pics de trafic soudains.
Notre engagement en faveur d'une haute disponibilité n'est pas qu'une simple promesse technique. La communauté des développeurs compte sur GitHub pour créer, déployer et exploiter leurs applications. Cela n'est possible que si vous pouvez compter sur nous, et le 17 août, ce n'était pas le cas. Il est de notre responsabilité de remédier à cette situation. Nous gagnerons votre confiance grâce à l'évolutivité et à la fiabilité de la plateforme."