Augusztus 13-án jelentős szolgáltatáskiesést tapasztaltunk, amely számos Spaceship szolgáltatást érintett.
Az ok a RadiusDC: Phoenix adatközpont hűtőrendszerének meghibásodása volt, amely a Spaceship egyes alapvető működési folyamatait biztosítja. Emiatt a szolgáltatásokat le kellett állítanunk, hogy megvédjük az ügyfelek infrastruktúráját a túlmelegedéstől és az esetleges károsodástól.
Az incidens által érintett minden szolgáltatás helyreállt, és csapataink továbbra is szorosan figyelik a rendszereket annak biztosítása érdekében, hogy stabilak maradjanak.
Őszintén sajnáljuk azokat az ügyfeleket ért hatást, akik weboldalaik, e-mailjük és egyéb online szolgáltatásaik tekintetében ránk támaszkodnak. Az ebből eredő fennakadást és a mögötte álló körülményeket rendkívül komolyan kezeljük.
Mi történt
Az incidens akkor kezdődött, amikor egy nagy vihar miatt meghibásodtak a Phoenix adatközpont hűtőrendszerei, aminek következtében az infrastruktúránk körüli hőmérséklet kritikus szintet ért el.
A rendszerek ilyen körülmények közötti további működtetése azzal a kockázattal járt volna, hogy a berendezések túlmelegszenek, és hosszabb távú, akár katasztrofális károsodást szenvednek. A szolgáltatások leállítása jelentős fennakadást okozott, de szükséges volt ügyfeleink infrastruktúrájának védelme érdekében.
Az is, hogy a berendezéseket offline állapotban tartottuk addig, amíg a hűtőrendszerek újra online nem kerültek, időt adott arra, hogy a hőmérséklet a helyreállítás megkezdése előtt visszatérjen a biztonságos szintre. Ez segített elkerülni további problémák kialakulását, amelyek még tovább elhúzhatták volna az amúgy is súlyos incidenst.
Hogyan érintette ez az ügyfeleket
A kiesés többek között a Shared, a VPS, az e-mail-továbbítás és a Spacemail szolgáltatásokat érintette. A Spaceship.com az incidens teljes időtartama alatt online maradt.
Az alábbiakban bemutatjuk, hogyan érintette a helyzet a főbb termékeket és szolgáltatásokat:
Tárhelyszolgáltatások működése
Az ügyfelek weboldalakhoz és tárhelyszolgáltatásokhoz való hozzáférése érintett volt: sok ügyfél weboldala nem volt elérhető, lassú volt, vagy hibát adott vissza. Egyes számlázási műveletek szintén nem voltak elérhetők, miután az ezeket feldolgozó rendszert az incidens során leállították.
EasyWP
Az EasyWP irányítópultja és az ügyfelek weboldalai is érintettek voltak. A helyreállítás során egyes ügyfélweboldalak az EasyWP.com és az irányítópult helyreállítása után is elérhetetlenek maradtak, és néhányuk adatbázis-kapcsolati hibát adott vissza.
Spacemail
Az e-mail-szolgáltatások is akadoztak. Az érintett ügyfelek nem tudtak e-mailt küldeni, a bejövő e-maileket pedig nem lehetett kézbesíteni, amíg az érintett szerverek offline állapotban voltak.
Fontos, hogy ez nem jelentette azt, hogy a bejövő üzenetek automatikusan elvesztek. A levelezőszolgáltatók általában újabb kézbesítési kísérleteket tesznek, amikor a fogadó szerver átmenetileg nem érhető el. Így az üzenetek megérkeztek, csak a szokásosnál később.
Hogyan állítottuk helyre a szolgáltatásokat
A RadiusDC a lehető leghamarabb megkezdte hűtési kapacitásának helyreállítását, miközben ideiglenes hűtőberendezéseket telepítettek, és azokat az adatközpontban a mi területünkre irányították, hogy segítsenek csökkenteni a hőmérsékletet.
Csapataink a helyszínen folyamatosan együtt dolgoztak a RadiusDC-vel a hűtés helyreállításán. A szolgáltatásokat csak akkor kezdtük újra online állapotba hozni, amikor a hőmérséklet visszatért a biztonságos működési szintre, és biztosak voltunk abban, hogy nincs túlmelegedési vagy hosszabb távú károsodási kockázat.
A biztonságos működési feltételek helyreállítása után megkezdtük infrastruktúránk ellenőrzött helyreállítását. Ennek fokozatosan kellett megtörténnie, ezért az ügyfelek azt tapasztalták, hogy a különböző szolgáltatások eltérő időpontokban álltak helyre.
Miért szakaszosan álltak helyre a szolgáltatások
Az incidens mértéke azt jelentette, hogy platformunk különböző részei egyszerre sérültek. Bár az ügyfelek ezeket különálló szolgáltatásokként érzékelik, az adatközponti incidens az ezek nyújtásában részt vevő infrastruktúrát is érintette.
Az olyan szolgáltatások, mint a tárhely és az e-mail, több technológiai rétegre támaszkodnak, beleértve a szervereket, hálózatokat, tárolást és adatbázisokat. Helyreállításuk azt jelentette, hogy ezeket a különböző elemeket a megfelelő sorrendben kellett újra online állapotba hozni, nem pedig egyszerűen mindent egyszerre visszakapcsolni.
Mi történik ezután
Nagyon komolyan vesszük ezt a fennakadást és annak ügyfeleinkre gyakorolt hatását.
Csapataink alaposan felülvizsgálják a helyzetet, hogy megerősítsék rendszereinket, és biztosítsák, hogy hasonló incidensek ne forduljanak elő újra.
Teljes mértékben átláthatóak leszünk azzal kapcsolatban, amit tanulunk, és megosztjuk Önnel az eredményeket, valamint az általunk megtett intézkedéseket.
HELYESBÍTÉS: Adatközpont-üzemeltetőnk a RadiusDC, nem pedig a PhoenixNAP, ahogyan arra több korai, augusztus 13-i X-bejegyzés hivatkozott. A PhoenixNAP nem érintett ebben az incidensben.
Ossza meg gondolatait