Масштабный сбой парализовал работу GitHub
Облачная платформа GitHub, ключевой ресурс для хостинга ИТ-проектов, столкнулась с масштабным сбоем, который сделал ее недоступной для значительной части пользователей. Инцидент начался в 9:40 утра по восточному времени (17:40 мск), когда компания официально подтвердила расследование проблем с производительностью, затронувших ряд ее сервисов. Сбой оперативно распространился на критически важные разделы платформы, включая запросы API, Actions, веб-хуки, Issues и Pull Requests, существенно нарушив рабочий процесс разработчиков по всему миру.
Ошибка масштабирования и шквал запросов VS Code
Администрация GitHub впоследствии опубликовала подробный отчет, объясняющий причины восьмичасового сбоя. Основными факторами были названы некорректная работа балансировщиков нагрузки и критическая ошибка в Visual Studio Code. Эта ошибка привела к образованию шквала повторных запросов, что усугубило нагрузку на систему и стало одной из ключевых причин масштабных неполадок. Сочетание этих факторов привело к длительным перебоям в работе платформы, демонстрируя уязвимость даже крупных облачных инфраструктур к комплексным техническим проблемам.
Очень интересно, как именно ошибка в VS Code спровоцировала такой шквал запросов. Неужели это была какая-то банальная рекурсия или более сложная проблема с кешированием? И как вообще GitHub планирует предотвращать подобные инциденты в будущем, учитывая их зависимость от внешних инструментов? Хотелось бы почитать подробнее об их планах по улучшению отказоустойчивости.