从Amazon最新云停机事故中学到的三个教训

从Amazon最新云停机事故中学到的三个教训

译文
作者:核子可乐译 2015-09-24 09:41:04

云计算

云安全 就在上周日上午时段,Amazon Web Services数据中心遭遇一起相当严重的意外事故。那么我们该从此次事故当中吸取哪些经验教训?下面请大家一同探讨其中的三项重点。

【51CTO.com快译】Amazon刚刚经历的云服务停机事故引发业界对云技术的又一番争论。

[[150337]]

就在上周日上午时段,Amazon Web Services数据中心遭遇一起相当严重的意外事故。

美国东部时间清晨六点,该公司负责承载AWS东弗吉尼亚区域负载的名为DynamoDB的大规模NoSQL数据库发生使用率暴涨状况——顺带一提,东弗吉尼亚州区域为该公司历史最悠久、规模***的九个全球性区域之一。到当日上午七点五十二分,AWS判断出问题根源:该数据库的元数据管理机制出现问题,直接影响到其服务的分区与表。

Amazon Web Services

Amazon Web Service的运行状况仪表板所示之上周日故障事件时间流程,其中包含引发问题的根本原因。

由于AWS服务使用极为复杂的互连机制,因此该问题滚雪球般影响到了总计117项受运行状况仪表板监控的服务类别当中的34项。从Elastic Comupte Cloud(即弹性计算云,简称EC2)到虚拟机、到Glacier存储服务再到Relational Database Service(即关系数据库服务)皆受到波及。根据媒体报道所言,其它采用AWS方案的企业客户亦遭到影响,其中包括Netflix、IMDB、Tinder、Pocket以及Buffer等知名公司。

截至上周日中午,AWS方面报告称问题已经得到解决,但在其期间Twitter及其它社交平台上出现了大量投诉与抱怨之声。

那么我们该从此次事故当中吸取哪些经验教训?下面请大家一同探讨其中的三项重点。

1.云服务巨头也有失蹄的时候

Amazon Web Services是目前公有IaaS云领域当之无愧的王者——虽然微软公司似乎也在这类业务身上砸下重金,但似乎仍然无法动摇Amazon的强势地位。上周日的事故则提醒我们,即使是规模***、经验最为老到的云服务供应商,也仍然有可能遭遇意料之外的突发状况。

2.时刻准备迎接停机事故

考虑到即使是市场上成熟程度***的云方案也仍然有可能——或者说实际遭遇到长达六个小时的服务停机,客户应当提前为此做好准备。AWS长久以来一直建议客户对自有系统进行架构规划,从而更加主动地应对可能出现的虚拟机或者其它服务停机。

DownDetector.com网站统计图表显示,Netflix公司上周日早晨的错误报告频率远高于正常状况。不过根据该公司的一位发言人所说,其服务并没有受到显著影响。

作为Amazon公司旗下规模***且***知名度的云服务客户之一,Netflix公司通过发言人强调称,此次停机事故给其服务造成的影响被控制在了***程度,这是因为其以自动化方式将工作负载从出现问题的美国东部区域设施迁移到了其它运行正常的区域。任何使用AWS承载关键性业务应用的客户都应当对系统架构进行调整,从而确保其能够在相关云服务出现意外状况时做好应对措施。Netflix公司还开发出了一系列开源工具,旨在帮助自身系统进行随机崩溃测试。尽管Netflix方面并不承认其客户因此次事故受到严重影响,不过第三方停机追踪站点却发布报告称,Netflix在上周日早间遭遇到远超过正常水平的服务中断频率。换言之,即使是做好了充分准备的高水平客户,也没办法完全避免云服务中断造成的影响。

3.“莫谓言之不预”

福布斯网站的一位博主认为,此次服务中断并不会改变云计算的未来普及趋势。我个人基本同意这种看法。如果大家身为AWS的拥护者,那么肯定会从积极的角度看待此次事件,例如中断事故的发生频率远低于以往,如果客户采取AWS推荐的***实践、那么这些意外也不会造成太大影响等等。

不过换个角度来看,像上周日这样的服务中断状况将成为有力证据,促使那些不愿将工作负载交给公有云打理的客户抱持更加顽固的心态。

事实上中断事故是不可避免的,其可能出现在公有云服务中、任意供应商处甚至连企业自己负责运行的内部数据中心也不放过。而这正是IT事务的本质与宿命,所以一味强调公有云存在可用性问题确实不太客观。

原文作者: Brandon Butler

原文标题:3 Big takeaways from Amazon’s latest cloud outage

【51CTO译稿,合作站点转载请注明原文译者和出处为51CTO.com】

 

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/247365.html<

(0)
管理的头像管理
上一篇2025-04-27 02:18
下一篇 2025-04-27 02:20

相关推荐

  • 站群服务器和普通服务器到底哪个更适合GEO,怎么选?

    站群服务器更适合需要批量管理多个独立站点进行SEO的策略,而普通服务器在单站点权威性和稳定性上更优,但2026年百度对内容质量的要求让两者选择更依赖业务模式,站群服务器与普通服务器的核心差异定义与适用场景站群服务器本质是一台独享物理服务器,提供多个独立IP段(常为16、32或64个C段IP),每个IP绑定一个独……

    2026-07-28
    0
  • 物理服务器和云服务器做站群到底选哪个,哪个更稳定?

    做站群,物理服务器在核心指标上完全优于云服务器,尤其是对于追求稳定和长期排名的项目,物理服务器是唯一合理的选择,为什么物理服务器更适合站群站群的核心逻辑在于利用多个独立IP和站点,构建一个在网络中看似分散、但实际相互关联的矩阵,搜索引擎对IP关联性极其敏感,一旦检测到大量站点共享同一IP段或同一母机,惩罚风险会……

    2026-07-28
    0
  • 国内高防服务器哪家防御真实靠谱,怎么选?

    国内高防服务器哪家防御真实靠谱?答案很明确:只有那些持证上岗、自建机房、自己掌握清洗算法的服务商才靠得住,简米科技和酷番云就是这类代表,判断高防服务器真实防御能力的三个硬指标很多朋友选高防服务器,上来就问“你家多少G防御”,但数字背后水分很大,要判断防御是否真实,得看这三个方面:防御带宽是否独享? 有些服务商宣……

    2026-07-28
    0
  • 裸金属服务器和物理服务器有什么区别?,怎么选?

    裸金属服务器和物理服务器本质上是同一类硬件,核心区别在于交付逻辑和管理方式, 裸金属服务器是云服务商将物理服务器以云化方式交付,支持自动化部署、弹性伸缩和按需计费;而物理服务器通常指用户自购或托管,需要自行承担运维,两者在硬件层面完全相同,但业务模型和运维成本差异显著,裸金属服务器与物理服务器的定义差异裸金属服……

    2026-07-28
    0
  • 做GEO站群选哪家服务器服务商靠谱,怎么选?

    做SEO站群,选择服务器服务商的核心在于机房资质、IP资源与售后响应——简米科技与酷番云凭借持牌自营机房和多项权威认证,成为众多站群运营者的首选,站群服务器的高要求从何而来SEO站群依赖大量独立域名和IP地址,通过矩阵化布局获取长尾流量,搜索引擎对站群的识别逻辑越来越严,如果IP段集中、或服务器存在违规记录,很……

    2026-07-28
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注