Op 13 augustus hebben we een grote service-uitval ervaren die een aantal Spaceship-services heeft getroffen.
De oorzaak was een storing in het koelsysteem in het RadiusDC: Phoenix-datacenter, waar enkele essentiële Spaceship-activiteiten worden gehost. Hierdoor moesten we services offline halen om de infrastructuur van klanten te beschermen tegen oververhitting en mogelijke schade.
Alles wat door het incident werd getroffen, is nu hersteld en onze teams blijven de systemen nauwlettend monitoren om ervoor te zorgen dat ze stabiel blijven.
Het spijt ons enorm voor de impact op klanten die voor hun websites, e-mail en andere online services van ons afhankelijk zijn. De verstoring die dit heeft veroorzaakt, en de omstandigheden erachter, worden uiterst serieus genomen.
Wat er is gebeurd
Het incident begon toen koelsystemen in het Phoenix-datacenter uitvielen als gevolg van een zware storm, waardoor de temperaturen rond onze infrastructuur kritieke niveaus bereikten.
Systemen onder zulke omstandigheden blijven gebruiken, bracht het risico met zich mee dat apparatuur oververhit zou raken en op langere termijn en catastrofale schade zou oplopen. Services offline halen veroorzaakte aanzienlijke verstoring, maar was noodzakelijk om de infrastructuur van onze klanten te beschermen.
Apparatuur offline houden totdat de koelsystemen weer online waren, gaf de temperaturen ook de tijd om terug te keren naar veilige niveaus voordat het herstel begon. Dit hielp voorkomen dat er verdere problemen ontstonden die een toch al ernstig incident nog verder hadden kunnen verlengen.
Hoe klanten werden getroffen
De uitval trof services waaronder Shared, VPS, e-mailforwarding en Spacemail. Spaceship.com bleef gedurende het hele incident online.
Hier volgt een overzicht van hoe de situatie belangrijke producten en services heeft beïnvloed:
Hostingactiviteiten
De toegang van klanten tot websites en hostingservices werd beïnvloed, waarbij veel websites van klanten niet beschikbaar waren, traag waren of fouten teruggaven. Sommige factureringsactiviteiten waren ook niet beschikbaar nadat het systeem dat verantwoordelijk was voor de verwerking ervan tijdens het incident offline was gehaald.
EasyWP
Het Dashboard van EasyWP en websites van klanten werden verstoord. Tijdens het herstel bleven sommige websites van klanten niet beschikbaar nadat EasyWP.com en het Dashboard waren hersteld, waarbij sommige fouten in de databaseverbinding teruggaven.
Spacemail
E-mailservices werden ook verstoord. Getroffen klanten konden geen e-mail verzenden en inkomende e-mail kon niet worden afgeleverd terwijl de relevante servers offline waren.
Belangrijk is dat dit niet betekende dat inkomende berichten automatisch verloren gingen. Mailproviders doen normaal gesproken verdere afleverpogingen wanneer een ontvangende server tijdelijk niet beschikbaar is. Berichten kwamen dus wel aan, maar later dan gebruikelijk.
Hoe we services hebben hersteld
RadiusDC begon zo snel mogelijk zijn koelcapaciteit te herstellen, terwijl tijdelijke koelinstallaties werden geplaatst en naar ons deel van het datacenter werden gericht om de temperaturen te helpen verlagen.
Onze teams hebben ter plaatse continu samengewerkt met RadiusDC om de koeling te herstellen. We zijn pas begonnen services weer online te brengen toen de temperaturen waren teruggekeerd naar veilige bedrijfsniveaus en we er zeker van waren dat er geen risico was op oververhitting of schade op langere termijn.
Toen de veilige bedrijfsomstandigheden waren hersteld, zijn we begonnen met een gecontroleerd herstel van onze infrastructuur. Dit moest geleidelijk gebeuren, waardoor klanten verschillende services op verschillende momenten terugzagen.
Waarom services in fasen werden hersteld
De omvang van het incident betekende dat verschillende delen van ons platform tegelijkertijd werden verstoord. Hoewel klanten deze als afzonderlijke services ervaren, had het incident in het datacenter invloed op de infrastructuur die betrokken is bij het leveren van een aantal daarvan.
Services zoals hosting en e-mail zijn afhankelijk van meerdere technologische lagen, waaronder servers, netwerken, opslag en databases. Het herstellen ervan betekende dat deze verschillende elementen in de juiste volgorde weer online moesten worden gebracht, in plaats van simpelweg alles tegelijk weer in te schakelen.
Wat er nu gebeurt
We nemen deze verstoring en de impact ervan op onze klanten zeer serieus.
Onze teams voeren een grondige evaluatie van de situatie uit om onze systemen te versterken en ervoor te zorgen dat soortgelijke incidenten niet opnieuw gebeuren.
We zullen volledig transparant zijn over wat we leren en zullen de resultaten met u delen, samen met de maatregelen die we nemen.
CORRECTIE: Onze datacenteroperator is RadiusDC, niet PhoenixNAP zoals vermeld in verschillende vroege berichten op X op 13 augustus. PhoenixNAP is niet betrokken bij dit incident.
Deel uw gedachten