13 sierpnia doświadczyliśmy poważnej awarii usług, która wpłynęła na szereg usług Spaceship.
Przyczyną była awaria systemu chłodzenia w centrum danych RadiusDC: Phoenix, które obsługuje niektóre kluczowe operacje Spaceship. Zmusiło nas to do wyłączenia usług, aby chronić infrastrukturę klientów przed przegrzaniem i możliwymi uszkodzeniami.
Wszystko, na co wpłynął ten incydent, zostało już przywrócone, a nasze zespoły nadal uważnie monitorują systemy, aby upewnić się, że pozostają stabilne.
Jest nam niezmiernie przykro z powodu wpływu na klientów, którzy polegają na nas w zakresie swoich stron internetowych, poczty e-mail i innych usług online. Zakłócenie, które to spowodowało, oraz okoliczności, które za nim stoją, są traktowane z najwyższą powagą.
Co się wydarzyło
Incydent rozpoczął się, gdy systemy chłodzenia w centrum danych Phoenix uległy awarii z powodu silnej burzy, powodując wzrost temperatury wokół naszej infrastruktury do krytycznych poziomów.
Dalsze działanie systemów w takich warunkach groziło przegrzaniem sprzętu oraz długoterminowymi i katastrofalnymi uszkodzeniami. Wyłączenie usług spowodowało znaczne zakłócenia, ale było konieczne, aby chronić infrastrukturę naszych klientów.
Utrzymanie sprzętu w stanie wyłączenia do czasu ponownego uruchomienia systemów chłodzenia dało również czas na powrót temperatur do bezpiecznych poziomów przed rozpoczęciem przywracania działania. Pomogło to uniknąć tworzenia kolejnych problemów, które mogłyby jeszcze bardziej wydłużyć i tak już poważny incydent.
Jak wpłynęło to na klientów
Awaria wpłynęła na usługi, w tym Shared, VPS, przekazywanie poczty e-mail i Spacemail. Spaceship.com pozostawał online przez cały czas trwania incydentu.
Poniżej przedstawiamy zestawienie tego, jak sytuacja wpłynęła na kluczowe produkty i usługi:
Operacje hostingowe
Wpłynęło to na dostęp klientów do stron internetowych i usług hostingowych — wiele stron klientów było niedostępnych, działało wolno lub zwracało błędy. Niektóre operacje rozliczeniowe również były niedostępne po tym, jak system odpowiedzialny za ich przetwarzanie został wyłączony podczas incydentu.
EasyWP
Panel EasyWP i strony internetowe klientów zostały zakłócone. Podczas przywracania działania niektóre strony klientów pozostawały niedostępne po przywróceniu EasyWP.com i panelu, a część z nich zwracała błędy połączenia z bazą danych.
Spacemail
Usługi e-mail również zostały zakłócone. Klienci, których to dotyczyło, nie mogli wysyłać wiadomości e-mail, a przychodzące wiadomości e-mail nie mogły zostać dostarczone, gdy odpowiednie serwery były wyłączone.
Co ważne, nie oznaczało to, że przychodzące wiadomości były automatycznie tracone. Dostawcy poczty zwykle podejmują kolejne próby dostarczenia, gdy serwer odbierający jest tymczasowo niedostępny. Oznacza to, że wiadomości docierały, ale później niż zwykle.
Jak przywróciliśmy usługi
RadiusDC rozpoczęło przywracanie wydajności chłodzenia tak szybko, jak to było możliwe, a jednocześnie zainstalowano tymczasowe agregaty chłodnicze i skierowano je do naszej strefy centrum danych, aby pomóc obniżyć temperaturę.
Nasze zespoły pracowały nieprzerwanie na miejscu wspólnie z RadiusDC, aby przywrócić chłodzenie. Zaczęliśmy ponownie uruchamiać usługi dopiero wtedy, gdy temperatury wróciły do bezpiecznych poziomów operacyjnych i mieliśmy pewność, że nie ma ryzyka przegrzania ani długoterminowych uszkodzeń.
Po przywróceniu bezpiecznych warunków operacyjnych rozpoczęliśmy kontrolowane odzyskiwanie działania całej naszej infrastruktury. Musiało to odbywać się stopniowo, dlatego klienci widzieli powrót różnych usług w różnym czasie.
Dlaczego usługi były przywracane etapami
Skala incydentu oznaczała, że różne części naszej platformy zostały zakłócone w tym samym czasie. Chociaż klienci postrzegają je jako oddzielne usługi, incydent w centrum danych wpłynął na infrastrukturę wykorzystywaną do świadczenia wielu z nich.
Usługi takie jak hosting i e-mail opierają się na wielu warstwach technologii, w tym serwerach, sieciach, pamięci masowej i bazach danych. Ich przywrócenie wymagało ponownego uruchomienia tych różnych elementów we właściwej kolejności, zamiast po prostu włączenia wszystkiego naraz.
Co wydarzy się dalej
Traktujemy to zakłócenie i jego wpływ na naszych klientów bardzo poważnie.
Nasze zespoły przeprowadzają dokładny przegląd sytuacji, aby wzmocnić nasze systemy i zapewnić, że podobne incydenty nie wydarzą się ponownie.
Będziemy całkowicie transparentni w kwestii tego, czego się dowiemy, i podzielimy się z Tobą wynikami oraz działaniami, które podejmujemy.
SPROSTOWANIE: Naszym operatorem centrum danych jest RadiusDC, a nie PhoenixNAP, jak wspomniano w kilku wczesnych postach na X z 13 sierpnia. PhoenixNAP nie jest zaangażowany w ten incydent.
Podziel się swoimi przemyśleniami