Spaceship Blog

Aktualisierung zum Spaceship-Dienstausfall

Aktualisierung zum Spaceship-Dienstausfall

Am 13. August kam es bei uns zu einem größeren Dienstausfall, der eine Reihe von Spaceship-Diensten beeinträchtigte.

Die Ursache war ein Ausfall des Kühlsystems im Rechenzentrum RadiusDC: Phoenix, in dem einige wesentliche Spaceship-Abläufe gehostet werden. Dadurch waren wir gezwungen, Dienste offline zu nehmen, um die Infrastruktur unserer Kunden vor Überhitzung und möglichen Schäden zu schützen.

Alles, was von dem Vorfall betroffen war, wurde inzwischen wiederhergestellt, und unsere Teams überwachen die Systeme weiterhin genau, um sicherzustellen, dass sie stabil bleiben.

Es tut uns zutiefst leid, welche Auswirkungen dies auf Kunden hatte, die sich bei ihren Websites, E-Mails und anderen Online-Diensten auf uns verlassen. Die dadurch verursachte Störung und die Umstände dahinter werden äußerst ernst genommen.

Was passiert ist

Der Vorfall begann, als die Kühlsysteme im Rechenzentrum Phoenix infolge eines schweren Sturms ausfielen, wodurch die Temperaturen rund um unsere Infrastruktur kritische Werte erreichten.

Den Betrieb von Systemen unter solchen Bedingungen fortzusetzen, hätte das Risiko mit sich gebracht, dass Geräte überhitzen und längerfristige sowie katastrophale Schäden erleiden. Das Offline-Nehmen von Diensten verursachte erhebliche Störungen, war jedoch notwendig, um die Infrastruktur unserer Kunden zu schützen.

Die Geräte offline zu halten, bis die Kühlsysteme wieder online waren, gab den Temperaturen außerdem Zeit, vor Beginn der Wiederherstellung wieder sichere Werte zu erreichen. Dies half, weitere Probleme zu vermeiden, die einen ohnehin schon schwerwiegenden Vorfall noch weiter hätten verlängern können.

Wie Kunden betroffen waren

Von dem Ausfall betroffen waren unter anderem Shared, VPS, E-Mail-Weiterleitung und Spacemail. Spaceship.com blieb während des gesamten Vorfalls online.

Hier ist eine Übersicht darüber, wie sich die Situation auf wichtige Produkte und Dienste ausgewirkt hat:

Hosting-Betrieb

Der Zugriff der Kunden auf Websites und Hosting-Dienste war beeinträchtigt; viele Kunden-Websites waren nicht verfügbar, langsam oder gaben Fehler zurück. Einige Abrechnungsvorgänge waren ebenfalls nicht verfügbar, nachdem das für ihre Verarbeitung zuständige System während des Vorfalls offline genommen wurde.

EasyWP

Das Dashboard von EasyWP und die Websites der Kunden waren beeinträchtigt. Während der Wiederherstellung blieben einige Kunden-Websites auch nach der Wiederherstellung von EasyWP.com und des Dashboards nicht verfügbar; bei einigen traten Fehler bei der Datenbankverbindung auf.

Spacemail

Auch die E-Mail-Dienste waren beeinträchtigt. Betroffene Kunden konnten keine E-Mails senden, und eingehende E-Mails konnten nicht zugestellt werden, solange die betreffenden Server offline waren.

Wichtig ist, dass dies nicht bedeutete, dass eingehende Nachrichten automatisch verloren gingen. Mail-Anbieter unternehmen normalerweise weitere Zustellversuche, wenn ein empfangender Server vorübergehend nicht verfügbar ist. Die Nachrichten kamen also an, aber später als gewöhnlich.

Wie wir die Dienste wiederhergestellt haben

RadiusDC begann so schnell wie möglich damit, seine Kühlkapazität wiederherzustellen, während vorübergehende Kühlaggregate installiert und in unseren Bereich des Rechenzentrums geleitet wurden, um die Temperaturen zu senken.

Unsere Teams arbeiteten vor Ort gemeinsam mit RadiusDC ununterbrochen daran, die Kühlung wiederherzustellen. Wir begannen erst dann damit, Dienste wieder online zu bringen, als die Temperaturen wieder sichere Betriebswerte erreicht hatten und wir sicher waren, dass kein Risiko einer Überhitzung oder längerfristiger Schäden bestand.

Nachdem sichere Betriebsbedingungen wiederhergestellt waren, begannen wir mit einer kontrollierten Wiederherstellung unserer Infrastruktur. Dies musste schrittweise erfolgen, sodass Kunden verschiedene Dienste zu unterschiedlichen Zeitpunkten zurückerhielten.

Warum die Dienste stufenweise wiederhergestellt wurden

Das Ausmaß des Vorfalls bedeutete, dass verschiedene Teile unserer Plattform gleichzeitig beeinträchtigt waren. Auch wenn Kunden diese als separate Dienste wahrnehmen, betraf der Vorfall im Rechenzentrum die Infrastruktur, die an der Bereitstellung mehrerer davon beteiligt ist.

Dienste wie Hosting und E-Mail sind auf mehrere Technologieebenen angewiesen, darunter Server, Netzwerke, Speicher und Datenbanken. Ihre Wiederherstellung bedeutete, diese verschiedenen Elemente in der richtigen Reihenfolge wieder online zu bringen, anstatt einfach alles auf einmal wieder einzuschalten.

Wie es weitergeht

Wir nehmen diese Störung und ihre Auswirkungen auf unsere Kunden sehr ernst. 

Unsere Teams führen eine gründliche Überprüfung der Situation durch, um unsere Systeme zu stärken und sicherzustellen, dass sich ähnliche Vorfälle nicht wiederholen.

Wir werden vollkommen transparent darüber sein, was wir daraus lernen, und die Ergebnisse zusammen mit den Maßnahmen, die wir ergreifen, mit Ihnen teilen.

KORREKTUR: Unser Rechenzentrumsbetreiber ist RadiusDC, nicht PhoenixNAP, wie in mehreren frühen Beiträgen auf X vom 13. August erwähnt. PhoenixNAP ist an diesem Vorfall nicht beteiligt.


Teilen Sie Ihre Gedanken

Mehr als 10 Zeichen erforderlich.
Ihre Identität für die öffentliche Anzeige.
Die Angabe Ihrer E-Mail-Adresse ist optional. Sie wird nicht mit Dritten geteilt.

Helfen Sie uns, unseren Blog zu verbessern

Teilen Sie Ihre Gedanken in einer schnellen zweiminütigen Umfrage.

Eine gültige E-Mail-Adresse ist erforderlich