Глобальный сбой в работе облака Amazon: хронология, причины и масштабы

  • Глобальный инцидент AWS с эпицентром в US-EAST-1, начавшийся около 9:00 утра (по времени полуострова)
  • Amazon обнаружил источник в DynamoDB и лежащую в его основе проблему DNS. К полудню все было постепенно восстановлено.
  • Влияние на несколько сервисов: Alexa, Prime Video, Canva, Duolingo, Snapchat и видеоигры, такие как Fortnite и Roblox.
  • Определенные последствия продолжались до полудня, в то время как принимались меры по смягчению последствий.

Общее изображение глобального сбоя AWS

Масштабный сбой в инфраструктуре Amazon Web Services (AWS) периодически нарушал работу тысяч платформ и приложений в разных странах. Рано утром пользователи стали чаще сообщать о проблемах с подключением, задержках и сбоях загрузки , особенно в США, а также наблюдались заметные последствия в Европе.

Согласно данным панели мониторинга состояния компании, проблема возникла в регионе US-EAST-1 (Северная Вирджиния) и вызвала необычный всплеск ошибок в нескольких API. К середине утра AWS сообщила о явных признаках восстановления работы многочисленных сервисов, хотя команды все еще работали над полным устранением проблемы и восстановлением нормальной работы всех систем.

Хронология инцидента

Первые оповещения поступили около 9:00 утра (по испанскому времени), вскоре после этого наблюдался пик инцидентов и постоянные уведомления в системах мониторинга, таких как DownDetector. С 11:00 утра компания сообщила, что выявила возможную причину и начала внедрять меры по устранению неполадок, которые ускорили восстановление на различных уровнях.

Около полудня AWS сообщила, что большинство операций возвращаются к нормальному режиму , хотя и отметила периодические ограничения на некоторые запросы и конкретные сервисы в пострадавшем регионе. В начале дня остаточные последствия всё ещё ощущались , поскольку продолжались работы по стабилизации.

Иллюстрация о проблемах в облаке Amazon

Где было техническое происхождение?

Компания сосредоточилась на Amazon DynamoDB , своем управляемом сервисе баз данных типа «ключ-значение», конечная точка которого в регионе US-EAST-1 столкнулась со сбоями, приведшими к каскадным ошибкам в нескольких зависимостях. AWS указала на проблему с DNS как на причину, и ее решение решалось поэтапно.

На практике, когда система доменных имен (DNS) не может корректно разрешить имена, приложения не могут найти свои ресурсы , что приводит к ошибкам подключения, таймаутам и сбоям загрузки данных. В качестве меры предосторожности AWS рекомендовала клиентам, испытывающим постоянные проблемы, очистить кэш DNS , чтобы восстановить разрешение имен на правильных конечных точках.

Кто пострадал

Последствия были масштабными: сама Amazon сообщила о проблемах с Alexa и Prime Video , а сторонние сервисы, такие как Canva , Duolingo и Snapchat, столкнулись с трудностями . Сбои также наблюдались в платформах генеративного ИИ и приложениях для совместной работы, использующих облако AWS.

Цифровые развлечения также не избежали последствий. Игры и сервисы с большой пользовательской базой, такие как Fortnite , Roblox и Clash Royale , сообщали об ошибках входа в систему или проблемах с подключением, в то время как некоторые магазины игр и лаунчеры внедряли меры по смягчению последствий до стабилизации трафика.

Влияние в Испании

По всей стране многочисленные пользователи сообщали о проблемах с доступом к приложениям и веб-сайтам цифровых сервисов, особенно в середине утра. Платформы по продаже билетов, такие как Ticketmaster, также пострадали, что привело к задержке начала продаж билетов, запланированных на полдень, включая билеты на долгожданные концерты.

Финансовые учреждения и крупные потребительские платформы сообщили об отдельных инцидентах в своих онлайн-системах, хотя их влияние различалось в зависимости от региона и предоставляемых услуг. По мере внедрения мер по смягчению последствий в пострадавшем регионе США наблюдалось постепенное восстановление доступа в Европе.

Текущая ситуация и рекомендации

С течением времени AWS сообщила о значительных признаках восстановления работы большинства своих сервисов, при этом сохраняя ограниченные ограничения на некоторые операции в районе US-EAST-1. Компания продолжает отслеживать производительность и вносить корректировки для полного решения проблемы.

Если у вас по-прежнему наблюдаются отдельные сбои, рекомендуется проверить официальный статус AWS и, при необходимости, очистить кэш DNS или перезапустить клиенты и службы, которые зависят от разрешения конечных точек в затронутом регионе. В критически важных развертываниях также рекомендуется проверить отказоустойчивость , сетевые зависимости и политики повторных попыток, чтобы минимизировать влияние задержек и временных ошибок.

В этом эпизоде ​​подчеркивается, насколько инфраструктура облачных вычислений стала структурной основой цифровой экономики: локальный сбой в ключевом узле может привести к цепным реакциям в глобальном масштабе, от потокового вещания и видеоигр до финансовых и производственных приложений.


Добавить в качестве предпочтительного источника в Google