Blog di Spaceship

Aggiornamento sull'interruzione del servizio Spaceship

Aggiornamento sull'interruzione del servizio Spaceship

Il 13 agosto abbiamo subito una grave interruzione del servizio che ha interessato diversi servizi di Spaceship.

La causa è stata un guasto al sistema di raffreddamento presso il data center RadiusDC: Phoenix, che ospita alcune operazioni essenziali di Spaceship. Questo ci ha costretti a mettere i servizi offline per proteggere l'infrastruttura dei clienti dal surriscaldamento e da possibili danni.

Tutto ciò che è stato interessato dall'incidente è stato ora ripristinato e i nostri team continuano a monitorare attentamente i sistemi per garantire che rimangano stabili.

Ci dispiace profondamente per l'impatto sui clienti che dipendono da noi per i loro siti web, le email e altri servizi online. L'interruzione che questo ha causato, e le circostanze che ne sono alla base, vengono prese con la massima serietà.

Cosa è successo

L'incidente è iniziato quando i sistemi di raffreddamento del data center di Phoenix hanno smesso di funzionare a causa di una forte tempesta, facendo raggiungere alle temperature intorno alla nostra infrastruttura livelli critici.

Continuare a far funzionare i sistemi in tali condizioni comportava il rischio che le apparecchiature si surriscaldassero e subissero danni catastrofici e a lungo termine. Mettere i servizi offline ha causato notevoli disagi, ma era necessario per proteggere l'infrastruttura dei nostri clienti.

Mantenere le apparecchiature offline fino a quando i sistemi di raffreddamento non fossero tornati online ha anche dato alle temperature il tempo di tornare a livelli sicuri prima dell'inizio del ripristino. Questo ha contribuito a evitare ulteriori problemi che avrebbero potuto prolungare ancora di più un incidente già grave.

Come sono stati interessati i clienti

L'interruzione ha interessato servizi tra cui Shared, VPS, inoltro email e Spacemail. Spaceship.com è rimasto online per tutta la durata dell'incidente.

Ecco una panoramica di come la situazione ha influito sui prodotti e servizi principali:

Operazioni di hosting

L'accesso dei clienti ai siti web e ai servizi di hosting è stato compromesso: molti siti web dei clienti non erano disponibili, erano lenti o restituivano errori. Anche alcune operazioni di fatturazione non erano disponibili dopo che il sistema responsabile della loro elaborazione è stato messo offline durante l'incidente.

EasyWP

La Dashboard di EasyWP e i siti web dei clienti hanno subito interruzioni. Durante il ripristino, alcuni siti web dei clienti sono rimasti non disponibili anche dopo il ripristino di EasyWP.com e della Dashboard, con alcuni che restituivano errori di connessione al database.

Spacemail

Anche i servizi email hanno subito interruzioni. I clienti interessati non potevano inviare email e le email in arrivo non potevano essere recapitate mentre i server pertinenti erano offline.

È importante sottolineare che questo non significava che i messaggi in arrivo fossero automaticamente persi. I provider di posta normalmente effettuano ulteriori tentativi di consegna quando un server di ricezione è temporaneamente non disponibile. Quindi i messaggi sarebbero arrivati, ma più tardi del solito.

Come abbiamo ripristinato i servizi

RadiusDC ha iniziato a ripristinare la propria capacità di raffreddamento il prima possibile, mentre venivano installati refrigeratori temporanei e convogliati nella nostra area del data center per contribuire a ridurre le temperature.

I nostri team hanno lavorato continuamente sul posto insieme a RadiusDC per ripristinare il raffreddamento. Abbiamo iniziato a riportare i servizi online solo quando le temperature sono tornate a livelli operativi sicuri e quando eravamo certi che non vi fosse alcun rischio di surriscaldamento o di danni a lungo termine.

Una volta ripristinate condizioni operative sicure, abbiamo avviato un recupero controllato della nostra infrastruttura. Questo ha dovuto avvenire progressivamente, quindi i clienti hanno visto il ritorno dei diversi servizi in momenti diversi.

Perché i servizi sono stati ripristinati in fasi

La portata dell'incidente ha fatto sì che diverse parti della nostra piattaforma subissero interruzioni nello stesso momento. Sebbene i clienti le percepiscano come servizi separati, l'incidente nel data center ha interessato l'infrastruttura coinvolta nell'erogazione di diversi di essi.

Servizi come hosting ed email si basano su più livelli di tecnologia, inclusi server, reti, archiviazione e database. Ripristinarli ha significato riportare online questi diversi elementi nell'ordine corretto, anziché semplicemente riaccendere tutto in una volta sola.

Cosa succede ora

Prendiamo questa interruzione e il suo impatto sui nostri clienti molto seriamente. 

I nostri team stanno conducendo una revisione approfondita della situazione per rafforzare i nostri sistemi e garantire che incidenti simili non si verifichino di nuovo.

Saremo completamente trasparenti su ciò che impareremo e condivideremo con voi i risultati, insieme alle azioni che stiamo intraprendendo.

CORREZIONE: Il nostro operatore di data center è RadiusDC, non PhoenixNAP come indicato in diversi primi post su X del 13 agosto. PhoenixNAP non è coinvolta in questo incidente.


Condividi i tuoi pensieri

Sono richiesti più di 10 caratteri.
La tua identità per la visualizzazione pubblica.
Fornire il tuo indirizzo email è facoltativo. Non sarà condiviso con terze parti.

Aiutaci a migliorare il nostro blog

Condividi i tuoi pensieri in un rapido sondaggio di due minuti.

È richiesto un indirizzo email valido