Blog Spaceship

Mise à jour sur l’interruption de service de Spaceship

Mise à jour sur l’interruption de service de Spaceship

Le 13 août, nous avons subi une panne majeure de service qui a affecté un certain nombre de services Spaceship.

La cause était une défaillance du système de refroidissement au centre de données RadiusDC: Phoenix, qui héberge certaines opérations essentielles de Spaceship. Cela nous a forcés à mettre des services hors ligne afin de protéger l’infrastructure des clients contre la surchauffe et d’éventuels dommages.

Tout ce qui a été affecté par l’incident a désormais été rétabli, et nos équipes continuent de surveiller étroitement les systèmes afin de s’assurer qu’ils restent stables.

Nous sommes profondément désolés de l’impact sur les clients qui dépendent de nous pour leurs sites web, leur messagerie et d’autres services en ligne. La perturbation que cela a causée, ainsi que les circonstances qui en sont à l’origine, sont prises extrêmement au sérieux.

Ce qui s’est passé

L’incident a commencé lorsque les systèmes de refroidissement sont tombés en panne au centre de données de Phoenix en raison d’une violente tempête, entraînant des températures critiques autour de notre infrastructure.

Continuer à faire fonctionner les systèmes dans de telles conditions risquait de provoquer une surchauffe des équipements et de leur causer des dommages catastrophiques et durables. La mise hors ligne des services a provoqué d’importantes perturbations, mais elle était nécessaire pour protéger l’infrastructure de nos clients.

Le fait de maintenir les équipements hors ligne jusqu’à ce que les systèmes de refroidissement soient de nouveau en ligne a également laissé le temps aux températures de revenir à des niveaux sûrs avant le début de la reprise. Cela a permis d’éviter de créer d’autres problèmes qui auraient pu prolonger davantage un incident déjà grave.

Comment les clients ont été affectés

La panne a affecté des services tels que Shared, VPS, le transfert d’e-mails et Spacemail. Spaceship.com est resté en ligne pendant toute la durée de l’incident.

Voici un aperçu de la manière dont la situation a affecté les principaux produits et services :

Opérations d’hébergement

L’accès des clients aux sites web et aux services d’hébergement a été affecté, de nombreux sites web de clients étant indisponibles, lents ou renvoyant des erreurs. Certaines opérations de facturation étaient également indisponibles après que le système chargé de les traiter a été mis hors ligne pendant l’incident.

EasyWP

Le tableau de bord d’EasyWP et les sites web des clients ont été perturbés. Pendant la reprise, certains sites web de clients sont restés indisponibles après le rétablissement de EasyWP.com et du tableau de bord, certains renvoyant des erreurs de connexion à la base de données.

Spacemail

Les services de messagerie ont également été perturbés. Les clients concernés ne pouvaient pas envoyer d’e-mails, et les e-mails entrants ne pouvaient pas être distribués tant que les serveurs concernés étaient hors ligne.

Il est important de noter que cela ne signifiait pas que les messages entrants étaient automatiquement perdus. Les fournisseurs de messagerie effectuent normalement de nouvelles tentatives de distribution lorsqu’un serveur de réception est temporairement indisponible. Les messages arrivaient donc, mais plus tard que d’habitude.

Comment nous avons rétabli les services

RadiusDC a commencé à rétablir sa capacité de refroidissement dès que possible, tandis que des refroidisseurs temporaires ont été installés et dirigés vers notre zone du centre de données afin d’aider à réduire les températures.

Nos équipes ont travaillé en continu sur site aux côtés de RadiusDC pour rétablir le refroidissement. Nous n’avons recommencé à remettre les services en ligne qu’une fois les températures revenues à des niveaux de fonctionnement sûrs, et lorsque nous étions convaincus qu’il n’y avait aucun risque de surchauffe ou de dommages à plus long terme.

Une fois des conditions de fonctionnement sûres rétablies, nous avons entamé une reprise contrôlée de notre infrastructure. Cela devait se faire progressivement, de sorte que les clients ont vu différents services revenir à des moments différents.

Pourquoi les services ont été rétablis par étapes

L’ampleur de l’incident signifiait que différentes parties de notre plateforme étaient perturbées en même temps. Bien que les clients les perçoivent comme des services distincts, l’incident du centre de données a affecté l’infrastructure impliquée dans la fourniture d’un certain nombre d’entre eux.

Des services comme l’hébergement et la messagerie reposent sur plusieurs couches technologiques, notamment des serveurs, des réseaux, du stockage et des bases de données. Les rétablir impliquait de remettre ces différents éléments en ligne dans le bon ordre, plutôt que de simplement tout rallumer d’un seul coup.

Ce qui se passe ensuite

Nous prenons cette perturbation et son impact sur nos clients très au sérieux. 

Nos équipes procèdent à un examen approfondi de la situation afin de renforcer nos systèmes et de veiller à ce que des incidents similaires ne se reproduisent pas.

Nous ferons preuve d’une transparence totale sur ce que nous apprendrons et nous partagerons avec vous les résultats, ainsi que les mesures que nous prenons.

CORRECTION : notre opérateur de centre de données est RadiusDC, et non PhoenixNAP comme indiqué dans plusieurs premiers messages publiés sur X le 13 août. PhoenixNAP n’est pas impliqué dans cet incident.


Partagez vos pensées

Plus de 10 caractères requis.
Votre identité pour l'affichage public.
Fournir votre adresse e-mail est facultatif. Elle ne sera pas partagée avec des tiers.

Aidez-nous à améliorer notre blog

Partagez vos pensées dans une enquête rapide de deux minutes.

Une adresse e-mail valide est requise