Spaceship 博客

Spaceship 服务中断更新

Spaceship 服务中断更新

8月13日,我们经历了一次重大服务中断,影响了多项 Spaceship 服务。

原因是托管部分 Spaceship 核心运营的数据中心 RadiusDC: Phoenix 的冷却系统发生故障。为保护客户基础设施免于过热和可能的损坏,我们不得不将服务下线。

目前,所有受此次事件影响的内容均已恢复,我们的团队仍在持续密切监控系统,以确保其保持稳定。

对于那些依赖我们提供网站、电子邮件和其他在线服务的客户所受到的影响,我们深表歉意。对此次中断造成的问题及其背后的情况,我们都极其严肃地对待。

发生了什么

此次事件始于 Phoenix 数据中心因强烈风暴导致冷却系统故障,使我们基础设施周围的温度达到临界水平。

在这种条件下继续运行系统,可能导致设备过热,并遭受长期且灾难性的损坏。将服务下线造成了严重中断,但这是保护客户基础设施所必需的。

在冷却系统恢复上线之前让设备保持离线状态,也为温度在恢复开始前回到安全水平争取了时间。这有助于避免引发更多问题,否则可能会进一步延长这一已经十分严重的事件。

客户受到了怎样的影响

此次中断影响了包括 Shared、VPS、电子邮件转发和 Spacemail 在内的服务。Spaceship.com 在整个事件期间始终保持在线。

以下是此次情况对主要产品和服务影响的细分说明:

主机运营

客户访问网站和主机服务受到影响,许多客户网站无法访问、速度缓慢或返回错误。由于负责处理这些操作的系统在事件期间被下线,部分计费操作也无法使用。

EasyWP

EasyWP 的控制面板和客户网站受到了影响。在恢复期间,尽管 EasyWP.com 和控制面板已恢复,部分客户网站仍然无法访问,其中一些返回了数据库连接错误。

Spacemail

电子邮件服务也受到了影响。受影响的客户无法发送电子邮件,并且在相关服务器离线期间,传入邮件也无法投递。

重要的是,这并不意味着传入邮件会自动丢失。邮件服务提供商通常会在接收服务器暂时不可用时继续尝试投递。因此,邮件最终会送达,但会比平时更晚。

我们如何恢复服务

RadiusDC 尽快开始恢复其冷却能力,同时安装了临时冷水机组,并将其导入我们所在的数据中心区域,以帮助降低温度。

我们的团队与 RadiusDC 一同在现场持续工作以恢复冷却。只有在温度恢复到安全运行水平,并且我们确信不存在过热或长期损坏风险后,我们才开始让服务重新上线。

在安全运行条件恢复后,我们开始对基础设施进行受控恢复。这个过程必须逐步进行,因此客户看到不同服务在不同时间恢复。

为什么服务是分阶段恢复的

此次事件的规模意味着我们平台的不同部分同时受到了影响。虽然客户将这些视为独立服务,但数据中心事件影响了提供其中多项服务所涉及的基础设施。

主机和电子邮件等服务依赖多层技术,包括服务器、网络、存储和数据库。恢复这些服务意味着必须按正确顺序让这些不同元素重新上线,而不是简单地一次性全部重新开启。

接下来会发生什么

我们非常严肃地对待此次中断及其对客户造成的影响。 

我们的团队正在对情况进行全面审查,以加强我们的系统,并确保类似事件不再发生。

我们将对所了解到的情况保持完全透明,并会与您分享结果以及我们正在采取的措施。

更正:我们的数据中心运营商是 RadiusDC,而不是 8月13日当天在 X 上几篇早期帖子中提到的 PhoenixNAP。PhoenixNAP 与此次事件无关。


分享您的想法

需要超过10个字符。
公开显示的身份。
提供您的电子邮件地址是可选的。我们不会与第三方共享。

帮助我们改进我们的博客

在快速两分钟的调查中分享您的想法。

需要提供有效的电子邮箱