Den 13. august opplevde vi et større tjenesteavbrudd som påvirket en rekke Spaceship-tjenester.
Årsaken var en svikt i kjølesystemet ved datasenteret RadiusDC: Phoenix, som er vert for noen viktige Spaceship-operasjoner. Dette tvang oss til å ta tjenester offline for å beskytte kundeinfrastrukturen mot overoppheting og mulig skade.
Alt som ble påvirket av hendelsen er nå gjenopprettet, og teamene våre fortsetter å overvåke systemene nøye for å sikre at de forblir stabile.
Vi beklager dypt konsekvensene for kunder som er avhengige av oss for sine nettsteder, e-post og andre nettjenester. Forstyrrelsen dette forårsaket, og omstendighetene bak den, blir tatt svært alvorlig.
Hva skjedde
Hendelsen begynte da kjølesystemene sviktet ved datasenteret i Phoenix på grunn av en kraftig storm, noe som førte til at temperaturene rundt infrastrukturen vår nådde kritiske nivåer.
Å fortsette å drive systemene under slike forhold innebar en risiko for at utstyret kunne overopphetes og få mer langvarige og katastrofale skader. Å ta tjenestene offline forårsaket betydelige forstyrrelser, men det var nødvendig for å beskytte kundenes infrastruktur.
Å holde utstyret offline til kjølesystemene var tilbake online ga også temperaturene tid til å komme tilbake til trygge nivåer før gjenopprettingen begynte. Dette bidro til å unngå å skape ytterligere problemer som kunne ha forlenget en allerede alvorlig hendelse enda mer.
Hvordan kundene ble påvirket
Avbruddet påvirket tjenester som Shared, VPS, e-postvideresending og Spacemail. Spaceship.com forble online gjennom hele hendelsen.
Her er en oversikt over hvordan situasjonen påvirket viktige produkter og tjenester:
Hostingoperasjoner
Kundetilgang til nettsteder og hostingtjenester ble påvirket, og mange kunders nettsteder var utilgjengelige, trege eller returnerte feil. Noen faktureringsoperasjoner var også utilgjengelige etter at systemet som håndterer dem ble tatt offline under hendelsen.
EasyWP
EasyWP sitt Dashboard og kundenes nettsteder ble forstyrret. Under gjenopprettingen forble noen kunders nettsteder utilgjengelige etter at EasyWP.com og Dashboard var gjenopprettet, og noen returnerte feil ved databasetilkobling.
Spacemail
E-posttjenester ble også forstyrret. Berørte kunder kunne ikke sende e-post, og innkommende e-post kunne ikke leveres mens de relevante serverne var offline.
Det er viktig å merke seg at dette ikke betydde at innkommende meldinger automatisk gikk tapt. E-postleverandører gjør normalt flere leveringsforsøk når en mottakende server er midlertidig utilgjengelig. Så meldinger ville komme frem, men senere enn vanlig.
Hvordan vi gjenopprettet tjenestene
RadiusDC begynte å gjenopprette kjølekapasiteten sin så raskt som mulig, mens midlertidige kjøleenheter ble installert og rettet inn mot vårt område av datasenteret for å bidra til å redusere temperaturene.
Teamene våre jobbet kontinuerlig på stedet sammen med RadiusDC for å gjenopprette kjølingen. Vi begynte først å sette tjenestene tilbake online da temperaturene hadde kommet tilbake til trygge driftsnivåer, og vi var sikre på at det ikke var noen risiko for overoppheting eller mer langvarig skade.
Da trygge driftsforhold var gjenopprettet, startet vi en kontrollert gjenoppretting på tvers av infrastrukturen vår. Dette måtte skje gradvis, så kundene opplevde at ulike tjenester kom tilbake til forskjellige tider.
Hvorfor tjenestene ble gjenopprettet i etapper
Omfanget av hendelsen betydde at ulike deler av plattformen vår ble forstyrret samtidig. Selv om kundene opplever disse som separate tjenester, påvirket datasenterhendelsen infrastrukturen som er involvert i leveringen av flere av dem.
Tjenester som hosting og e-post er avhengige av flere teknologilag, inkludert servere, nettverk, lagring og databaser. Å gjenopprette dem betydde å bringe disse ulike elementene tilbake online i riktig rekkefølge, i stedet for bare å slå alt på igjen samtidig.
Hva skjer videre
Vi tar denne forstyrrelsen og dens innvirkning på kundene våre svært alvorlig.
Teamene våre gjennomfører en grundig gjennomgang av situasjonen for å styrke systemene våre og sikre at lignende hendelser ikke skjer igjen.
Vi vil være helt åpne om det vi lærer og vil dele resultatene med dere, sammen med tiltakene vi setter i verk.
RETTELSE: Datasenteroperatøren vår er RadiusDC, ikke PhoenixNAP som nevnt i flere tidlige innlegg på X den 13. august. PhoenixNAP er ikke involvert i denne hendelsen.
Del dine tanker