На 13 август преживяхме сериозно прекъсване на услугите, което засегна редица услуги на Spaceship.
Причината беше повреда в охладителната система в центъра за данни RadiusDC: Phoenix, който хоства някои основни операции на Spaceship. Това ни принуди да изведем услугите офлайн, за да защитим клиентската инфраструктура от прегряване и възможни повреди.
Всичко, засегнато от инцидента, вече е възстановено и нашите екипи продължават да наблюдават системите отблизо, за да гарантират, че остават стабилни.
Искрено съжаляваме за въздействието върху клиентите, които разчитат на нас за своите уебсайтове, имейл и други онлайн услуги. Причиненото от това прекъсване и обстоятелствата зад него се приемат изключително сериозно.
Какво се случи
Инцидентът започна, когато охладителните системи в центъра за данни Phoenix отказаха поради силна буря, което доведе до достигане на критични нива на температурите около нашата инфраструктура.
Продължаването на работата на системите при такива условия криеше риск оборудването да прегрее и да претърпи по-дългосрочни и катастрофални повреди. Извеждането на услугите офлайн причини значително прекъсване, но беше необходимо, за да защитим инфраструктурата на нашите клиенти.
Поддържането на оборудването офлайн, докато охладителните системи отново заработят, също даде време на температурите да се върнат до безопасни нива, преди да започне възстановяването. Това помогна да се избегне създаването на допълнителни проблеми, които можеха още повече да удължат един и без това сериозен инцидент.
Как бяха засегнати клиентите
Прекъсването засегна услуги, включително Shared, VPS, препращане на имейли и Spacemail. Spaceship.com остана онлайн през целия инцидент.
Ето разбивка на това как ситуацията засегна основните продукти и услуги:
Хостинг операции
Достъпът на клиентите до уебсайтове и хостинг услуги беше засегнат, като много клиентски уебсайтове бяха недостъпни, бавни или връщаха грешки. Някои операции по фактуриране също бяха недостъпни, след като системата, отговорна за обработката им, беше изведена офлайн по време на инцидента.
EasyWP
Таблото за управление на EasyWP и клиентските уебсайтове бяха засегнати. По време на възстановяването някои клиентски уебсайтове останаха недостъпни, след като EasyWP.com и таблото за управление бяха възстановени, като някои връщаха грешки при свързване с базата данни.
Spacemail
Имейл услугите също бяха засегнати. Засегнатите клиенти не можеха да изпращат имейли, а входящите имейли не можеха да бъдат доставени, докато съответните сървъри бяха офлайн.
Важно е да се отбележи, че това не означаваше, че входящите съобщения автоматично са били загубени. Доставчиците на поща обикновено правят допълнителни опити за доставка, когато получаващият сървър е временно недостъпен. Така че съобщенията щяха да пристигнат, но по-късно от обичайното.
Как възстановихме услугите
RadiusDC започна да възстановява охладителния си капацитет възможно най-скоро, докато бяха инсталирани временни охладители и насочени към нашата зона в центъра за данни, за да помогнат за намаляване на температурите.
Нашите екипи работиха непрекъснато на място заедно с RadiusDC, за да възстановят охлаждането. Започнахме да връщаме услугите онлайн едва след като температурите се върнаха до безопасни работни нива и бяхме уверени, че няма риск от прегряване или по-дългосрочни повреди.
След като безопасните работни условия бяха възстановени, започнахме контролирано възстановяване в цялата ни инфраструктура. Това трябваше да се случва постепенно, така че клиентите видяха различните услуги да се връщат в различно време.
Защо услугите бяха възстановени на етапи
Мащабът на инцидента означаваше, че различни части от нашата платформа бяха засегнати едновременно. Макар клиентите да ги възприемат като отделни услуги, инцидентът в центъра за данни засегна инфраструктурата, участваща в предоставянето на редица от тях.
Услуги като хостинг и имейл разчитат на множество технологични слоеве, включително сървъри, мрежи, съхранение и бази данни. Възстановяването им означаваше тези различни елементи да бъдат върнати онлайн в правилния ред, вместо просто всичко да бъде включено отново наведнъж.
Какво следва
Приемаме това прекъсване и въздействието му върху нашите клиенти много сериозно.
Нашите екипи извършват задълбочен преглед на ситуацията, за да укрепят системите ни и да гарантират, че подобни инциденти няма да се случат отново.
Ще бъдем напълно прозрачни относно това, което научим, и ще споделим резултатите с вас, заедно с действията, които предприемаме.
КОРЕКЦИЯ: Нашият оператор на центъра за данни е RadiusDC, а не PhoenixNAP, както беше посочено в няколко ранни публикации в X на 13 август. PhoenixNAP не участва в този инцидент.
Споделете вашето мнение