8月13日,我们经历了一次重大服务中断,影响了多项 Spaceship 服务。
原因是托管部分 Spaceship 核心运营的数据中心 RadiusDC: Phoenix 的冷却系统发生故障。为保护客户基础设施免于过热和可能的损坏,我们不得不将服务下线。
目前,所有受此次事件影响的内容均已恢复,我们的团队仍在持续密切监控系统,以确保其保持稳定。
对于那些依赖我们提供网站、电子邮件和其他在线服务的客户所受到的影响,我们深表歉意。对此次中断造成的问题及其背后的情况,我们都极其严肃地对待。
发生了什么
此次事件始于 Phoenix 数据中心因强烈风暴导致冷却系统故障,使我们基础设施周围的温度达到临界水平。
在这种条件下继续运行系统,可能导致设备过热,并遭受长期且灾难性的损坏。将服务下线造成了严重中断,但这是保护客户基础设施所必需的。
在冷却系统恢复上线之前让设备保持离线状态,也为温度在恢复开始前回到安全水平争取了时间。这有助于避免引发更多问题,否则可能会进一步延长这一已经十分严重的事件。
客户受到了怎样的影响
此次中断影响了包括 Shared、VPS、电子邮件转发和 Spacemail 在内的服务。Spaceship.com 在整个事件期间始终保持在线。
以下是此次情况对主要产品和服务影响的细分说明:
主机运营
客户访问网站和主机服务受到影响,许多客户网站无法访问、速度缓慢或返回错误。由于负责处理这些操作的系统在事件期间被下线,部分计费操作也无法使用。
EasyWP
EasyWP 的控制面板和客户网站受到了影响。在恢复期间,尽管 EasyWP.com 和控制面板已恢复,部分客户网站仍然无法访问,其中一些返回了数据库连接错误。
Spacemail
电子邮件服务也受到了影响。受影响的客户无法发送电子邮件,并且在相关服务器离线期间,传入邮件也无法投递。
重要的是,这并不意味着传入邮件会自动丢失。邮件服务提供商通常会在接收服务器暂时不可用时继续尝试投递。因此,邮件最终会送达,但会比平时更晚。
我们如何恢复服务
RadiusDC 尽快开始恢复其冷却能力,同时安装了临时冷水机组,并将其导入我们所在的数据中心区域,以帮助降低温度。
我们的团队与 RadiusDC 一同在现场持续工作以恢复冷却。只有在温度恢复到安全运行水平,并且我们确信不存在过热或长期损坏风险后,我们才开始让服务重新上线。
在安全运行条件恢复后,我们开始对基础设施进行受控恢复。这个过程必须逐步进行,因此客户看到不同服务在不同时间恢复。
为什么服务是分阶段恢复的
此次事件的规模意味着我们平台的不同部分同时受到了影响。虽然客户将这些视为独立服务,但数据中心事件影响了提供其中多项服务所涉及的基础设施。
主机和电子邮件等服务依赖多层技术,包括服务器、网络、存储和数据库。恢复这些服务意味着必须按正确顺序让这些不同元素重新上线,而不是简单地一次性全部重新开启。
接下来会发生什么
我们非常严肃地对待此次中断及其对客户造成的影响。
我们的团队正在对情况进行全面审查,以加强我们的系统,并确保类似事件不再发生。
我们将对所了解到的情况保持完全透明,并会与您分享结果以及我们正在采取的措施。
更正:我们的数据中心运营商是 RadiusDC,而不是 8月13日当天在 X 上几篇早期帖子中提到的 PhoenixNAP。PhoenixNAP 与此次事件无关。
分享您的想法