Топ 5 сбоев, которые на время нарушили работу привычных сервисов

Ошибочная команда или дефект обновления могут затронуть миллионы людей. Пять сбоев показывают, как технические детали связаны с привычными сервисами.

Топ 5 сбоев, которые на время нарушили работу привычных сервисов

Когда не открывается сайт, не запускается рабочий компьютер или пропадает доступ к облачному хранилищу, причина часто находится далеко от экрана пользователя. Несколько крупных сбоев последних лет показали, насколько много привычных сервисов зависит от обновлений, сетевых маршрутов и оборудования дата-центров. Здесь собраны разные типы отказов: ни один не был «одним выключателем для всего интернета», но каждый заметно затронул организации и людей.

В начале списка отказ ограничил доступ к панели управления отдельного провайдера; ближе к первому месту сбои затрагивали больше привычных сервисов и рабочих компьютеров. Для каждого случая важна точная граница: крупный сбой не означает, что отключилось всё вокруг.

МестоСбойЧто пошло не такМасштаб последствий
5Cloudflare, 2023Отказ электропитания в крупном дата-центреНарушилась работа панели управления и аналитики, но не трафика через сеть
4Fastly, 2021Исправный запрос клиента активировал скрытую ошибкуБольшая часть сети Fastly стала выдавать ошибки
3AWS S3, 2017Команда сняла с работы больше серверов, чем планировалосьПострадали S3 и зависимые сервисы в регионе США-Восток
2Meta, 2021Маршруты к сети компании стали недоступныFacebook, Instagram и WhatsApp пропали на несколько часов
1CrowdStrike, 2024Ошибка в обновлении защитного ПО для WindowsМногие компьютеры не могли загрузиться

5. Cloudflare, 2023

В ноябре 2023 года отключение одного из независимых вводов электропитания нарушило работу дата-центра в Орегоне, который использовала Cloudflare. Резервные генераторы запустились, но оставшаяся проблема с питанием остановила часть оборудования. Сильнее всего пострадали панель управления, API и аналитические системы: некоторые клиенты не могли менять настройки и получать журналы событий.

Здесь особенно важна оговорка, которую легко потерять в громком заголовке. Сеть доставки и защиты трафика Cloudflare продолжала работать. Пользователь мог открыть сайт, даже если его владелец не мог зайти в панель управления и изменить настройки. После включения резервной площадки часть сервисов перегрузилась потоком накопившихся запросов, поэтому восстановление шло поэтапно.

Этот случай попал в список за другую уязвимость: отказ внешней инженерной инфраструктуры и скрытые зависимости между системами, которые считались резервными. Он не выключил сеть Cloudflare целиком. Точное описание последствий полезнее сенсационного заявления, будто «половина интернета упала»: масштаб сбоя зависит от того, какая именно функция перестала работать.

Крупные сбои редко объясняются одной строкой кода. Ошибка запускает цепочку, но её размер зависит от общей архитектуры, резервирования и скорости восстановления. Поэтому грамотные постмортемы описывают не только первую неверную команду или обновление, но и то, почему одна проблема смогла дойти до такого числа пользователей.

4. Fastly, 2021

В июне 2021 года сеть доставки контента Fastly начала возвращать ошибки для большого числа сайтов. Компания сообщила, что дефект появился после обновления программного обеспечения, развернутого несколькими неделями раньше. Он оставался скрытым, пока один клиент не внес совершенно корректное изменение конфигурации. Именно сочетание новой настройки с невыявленной ошибкой запустило сбой.

Fastly обнаружила проблему в течение минуты и стала отключать затронутую конфигурацию. Компания сообщила, что через 49 минут в нормальный режим вернулись 95 процентов сети. На это время недоступными оказывались сайты СМИ, магазины, платёжные и развлекательные платформы, использовавшие Fastly как промежуточный слой между сервером и читателем.

Причина здесь отличается от сбоя Meta: не исчез маршрут к одной компании, а дефект разошёлся по общей инфраструктуре, которой пользовались разные организации. Ошибка была в софте, но толчком стало законное изменение клиента. Поэтому команда сервиса объявила о доработке тестирования и изоляции компонентов: важны не только аккуратные действия пользователей, но и способность сети локализовать последствия.

3. AWS S3, 2017

28 февраля 2017 года сотрудник AWS выполнял плановую процедуру обслуживания системы Amazon S3 в регионе Северная Вирджиния. Команда должна была отключить небольшое число серверов одной подсистемы. В ней ошиблись с введённым параметром, и оборудования вывели из работы заметно больше, чем намеревались. Это нарушило работу индекса и системы размещения данных – компонентов, от которых зависит обслуживание файлов.

Сбой распространился на другие продукты AWS, которые использовали S3. Новые виртуальные машины запускались с трудом, некоторые приложения теряли доступ к данным, а собственная панель статуса AWS тоже не могла нормально обновляться, поскольку зависела от S3. Компания отдельно уточнила географические границы: событие затронуло регион us-east-1, а не всю мировую инфраструктуру AWS.

Системы были рассчитаны на потерю части серверов, но не на столь резкое удаление мощности и долгий перезапуск старых подсистем. После инцидента AWS ограничила скорость отключения ресурсов и добавила защиту от слишком большого шага. История важна тем, что ошибка была простой, а последствия усилили архитектурные зависимости и сложность восстановления.

2. Meta, 2021

4 октября 2021 года Facebook, Instagram и WhatsApp одновременно перестали открываться. Инженерный разбор Meta объяснил, что изменения в сетевой инфраструктуре нарушили связь между дата-центрами компании. Затем площадки, обслуживавшие DNS-запросы, объявили себя недоступными и убрали сетевые маршруты, по которым другие сети могли найти эти адреса.

Пользователю казалось, что исчезли сами приложения. На деле ключевые серверы продолжали существовать, но путь к ним пропал из таблиц маршрутизации. Это похоже на ситуацию, когда здание на месте, но его адресные указатели исчезли со всех дорог сразу. Сотрудникам компании было трудно добраться и до внутренних инструментов, поэтому восстановление оказалось сложнее обычного перезапуска.

Сбой длился несколько часов и затронул миллиардную аудиторию сервисов. Он показал, что DNS и протоколы маршрутизации – не абстрактный фон: от согласованной работы этих систем зависит, увидит ли браузер страницу. В отличие от ошибки обновления CrowdStrike, здесь компьютеры пользователей работали, но сетевые объявления самой компании перестали вести к её платформам.

1. CrowdStrike, 2024

19 июля 2024 года обновление содержимого защитного продукта CrowdStrike Falcon вызвало сбой Windows-компьютеров, где был установлен агент. На экранах многих устройств появилась критическая ошибка, и система не могла нормально загрузиться. Это затронуло не только обычные офисы: перебои испытывали авиакомпании, больницы, банки и другие организации, использовавшие Windows в повседневной работе.

Важно не перепутать событие с кибератакой. Проблема возникла из-за обновления в продукте безопасности, а не из-за злоумышленника, который взломал компьютеры. Microsoft и CrowdStrike публиковали инструкции по восстановлению, но на некоторых машинах требовалось вручную загрузиться в специальный режим и исправить файлы. Для распределённых сетей с тысячами устройств даже исправление одной и той же причины превратилось в большую логистическую задачу.

Этот сбой отличается от остальных тем, что отказали сами рабочие станции пользователей, а не только удалённый сервис. Облачные приложения могли оставаться доступными, но человек всё равно не мог открыть их на компьютере. Он напомнил, что защитное программное обеспечение тоже обновляется и поэтому нуждается в тестировании, безопасном развёртывании и возможности отката.

Начните вводить запрос.