Den 13 augusti drabbades vi av ett större tjänstavbrott som påverkade ett antal av Spaceships tjänster.
Orsaken var ett fel i kylsystemet i datacentret RadiusDC: Phoenix, som är värd för vissa viktiga Spaceship-funktioner. Detta tvingade oss att ta tjänster offline för att skydda kundinfrastrukturen från överhettning och möjliga skador.
Allt som påverkades av incidenten har nu återställts, och våra team fortsätter att övervaka systemen noggrant för att säkerställa att de förblir stabila.
Vi är djupt ledsna för påverkan på kunder som är beroende av oss för sina webbplatser, sin e-post och andra onlinetjänster. Den störning som detta orsakade, och omständigheterna bakom den, tas på största allvar.
Vad hände
Incidenten började när kylsystemen i datacentret i Phoenix slutade fungera på grund av en kraftig storm, vilket gjorde att temperaturerna runt vår infrastruktur nådde kritiska nivåer.
Att fortsätta driva systemen under sådana förhållanden riskerade att utrustningen överhettades och fick mer långsiktiga och katastrofala skador. Att ta tjänster offline orsakade betydande störningar, men det var nödvändigt för att skydda våra kunders infrastruktur.
Att hålla utrustningen offline tills kylsystemen var online igen gav också temperaturerna tid att återgå till säkra nivåer innan återställningen började. Detta bidrog till att undvika att skapa ytterligare problem som kunde ha förlängt en redan allvarlig incident ännu mer.
Hur kunderna påverkades
Avbrottet påverkade tjänster inklusive Shared, VPS, vidarebefordran av e-post och Spacemail. Spaceship.com förblev online under hela incidenten.
Här är en sammanfattning av hur situationen påverkade viktiga produkter och tjänster:
Hostingverksamhet
Kunders åtkomst till webbplatser och hostingtjänster påverkades, och många kundwebbplatser var otillgängliga, långsamma eller returnerade fel. Vissa faktureringsfunktioner var också otillgängliga efter att systemet som ansvarar för att behandla dem togs offline under incidenten.
EasyWP
EasyWP:s Dashboard och kundwebbplatser stördes. Under återställningen förblev vissa kundwebbplatser otillgängliga efter att EasyWP.com och Dashboard hade återställts, och vissa returnerade fel för databasanslutning.
Spacemail
E-posttjänsterna stördes också. Berörda kunder kunde inte skicka e-post, och inkommande e-post kunde inte levereras medan de relevanta servrarna var offline.
Viktigt är att detta inte innebar att inkommande meddelanden automatiskt gick förlorade. E-postleverantörer gör normalt ytterligare leveransförsök när en mottagande server tillfälligt är otillgänglig. Så meddelanden skulle komma fram, men senare än vanligt.
Hur vi återställde tjänsterna
RadiusDC började återställa sin kylkapacitet så snart som möjligt, medan tillfälliga kylaggregat installerades och riktades mot vårt område i datacentret för att hjälpa till att sänka temperaturerna.
Våra team arbetade kontinuerligt på plats tillsammans med RadiusDC för att återställa kylningen. Vi började först ta tjänster online igen när temperaturerna hade återgått till säkra driftsnivåer och vi var säkra på att det inte fanns någon risk för överhettning eller mer långsiktiga skador.
När säkra driftförhållanden hade återställts började vi en kontrollerad återhämtning i hela vår infrastruktur. Detta behövde ske stegvis, så kunderna såg olika tjänster komma tillbaka vid olika tidpunkter.
Varför tjänsterna återställdes i etapper
Incidentens omfattning innebar att olika delar av vår plattform stördes samtidigt. Även om kunder upplever dessa som separata tjänster påverkade incidenten i datacentret den infrastruktur som används för att leverera ett antal av dem.
Tjänster som hosting och e-post är beroende av flera tekniklager, inklusive servrar, nätverk, lagring och databaser. Att återställa dem innebar att dessa olika delar behövde tas online igen i rätt ordning, i stället för att helt enkelt slå på allt igen på en gång.
Vad händer härnäst
Vi tar denna störning och dess påverkan på våra kunder på största allvar.
Våra team genomför en grundlig granskning av situationen för att stärka våra system och säkerställa att liknande incidenter inte inträffar igen.
Vi kommer att vara helt transparenta med vad vi lär oss och kommer att dela resultaten med er, tillsammans med de åtgärder vi vidtar.
RÄTTELSE: Vår datacenteroperatör är RadiusDC, inte PhoenixNAP som nämndes i flera tidiga inlägg på X den 13 augusti. PhoenixNAP är inte involverat i denna incident.
Dela dina tankar