Pe 13 august, am avut o întrerupere majoră a serviciilor care a afectat o serie de servicii Spaceship.
Cauza a fost o defecțiune a sistemului de răcire la centrul de date RadiusDC: Phoenix, care găzduiește unele operațiuni esențiale ale Spaceship. Acest lucru ne-a obligat să scoatem serviciile offline pentru a proteja infrastructura clienților de supraîncălzire și de posibile daune.
Tot ceea ce a fost afectat de incident a fost acum restaurat, iar echipele noastre continuă să monitorizeze îndeaproape sistemele pentru a se asigura că rămân stabile.
Ne pare profund rău pentru impactul asupra clienților care depind de noi pentru site-urile lor web, emailul lor și alte servicii online. Perturbarea pe care aceasta a cauzat-o și circumstanțele din spatele ei sunt tratate cu maximă seriozitate.
Ce s-a întâmplat
Incidentul a început când sistemele de răcire au cedat la centrul de date Phoenix din cauza unei furtuni majore, ceea ce a făcut ca temperaturile din jurul infrastructurii noastre să atingă niveluri critice.
Continuarea operării sistemelor în astfel de condiții risca supraîncălzirea echipamentelor și producerea unor daune pe termen mai lung și catastrofale. Scoaterea serviciilor offline a cauzat perturbări semnificative, dar a fost necesară pentru a proteja infrastructura clienților noștri.
Menținerea echipamentelor offline până când sistemele de răcire au revenit online a oferit, de asemenea, timp temperaturilor să revină la niveluri sigure înainte de începerea recuperării. Acest lucru a ajutat la evitarea creării unor probleme suplimentare care ar fi putut prelungi și mai mult un incident deja grav.
Cum au fost afectați clienții
Întreruperea a afectat servicii precum Shared, VPS, redirecționarea emailurilor și Spacemail. Spaceship.com a rămas online pe tot parcursul incidentului.
Iată o prezentare a modului în care situația a afectat produsele și serviciile cheie:
Operațiuni de găzduire
Accesul clienților la site-uri web și la serviciile de găzduire a fost afectat, multe site-uri ale clienților fiind indisponibile, lente sau returnând erori. Unele operațiuni de facturare au fost, de asemenea, indisponibile după ce sistemul responsabil de procesarea lor a fost scos offline în timpul incidentului.
EasyWP
Panoul de control EasyWP și site-urile clienților au fost afectate. În timpul recuperării, unele site-uri ale clienților au rămas indisponibile după ce EasyWP.com și panoul de control au fost restaurate, unele returnând erori de conectare la baza de date.
Spacemail
Serviciile de email au fost, de asemenea, afectate. Clienții afectați nu au putut trimite emailuri, iar emailurile primite nu au putut fi livrate cât timp serverele relevante au fost offline.
Important este că acest lucru nu a însemnat că mesajele primite s-au pierdut automat. Furnizorii de email fac în mod normal încercări suplimentare de livrare atunci când un server de primire este temporar indisponibil. Așadar, mesajele ar fi ajuns, dar mai târziu decât de obicei.
Cum am restaurat serviciile
RadiusDC a început să își restabilească capacitatea de răcire cât mai curând posibil, în timp ce au fost instalate chillere temporare și direcționate către zona noastră din centrul de date pentru a ajuta la reducerea temperaturilor.
Echipele noastre au lucrat continuu la fața locului alături de RadiusDC pentru a restabili răcirea. Am început să readucem serviciile online doar după ce temperaturile au revenit la niveluri sigure de funcționare și am fost încrezători că nu exista niciun risc de supraîncălzire sau de daune pe termen mai lung.
Odată restabilite condițiile sigure de funcționare, am început o recuperare controlată în întreaga noastră infrastructură. Acest lucru a trebuit să se întâmple progresiv, astfel încât clienții au văzut servicii diferite revenind în momente diferite.
De ce serviciile au fost restaurate în etape
Amploarea incidentului a însemnat că diferite părți ale platformei noastre au fost afectate în același timp. Deși clienții le percep ca servicii separate, incidentul din centrul de date a afectat infrastructura implicată în furnizarea unui număr de astfel de servicii.
Servicii precum găzduirea și emailul se bazează pe mai multe straturi de tehnologie, inclusiv servere, rețele, stocare și baze de date. Restaurarea lor a însemnat readucerea acestor elemente diferite online în ordinea corectă, în loc să repornim pur și simplu totul deodată.
Ce urmează
Tratăm această perturbare și impactul ei asupra clienților noștri cu maximă seriozitate.
Echipele noastre efectuează o analiză amănunțită a situației pentru a ne consolida sistemele și pentru a ne asigura că incidente similare nu se vor mai repeta.
Vom fi complet transparenți cu privire la ceea ce învățăm și vă vom împărtăși rezultatele, împreună cu măsurile pe care le luăm.
CORECȚIE: Operatorul nostru de centru de date este RadiusDC, nu PhoenixNAP, așa cum s-a menționat în mai multe postări timpurii de pe X din 13 august. PhoenixNAP nu este implicat în acest incident.
Împărtășiți-vă gândurile