提高AWS可用性?试试流量转移

提高AWS可用性?试试流量转移

作者:Chris Moyer 2015-12-15 10:23:30

云计算 当开发者需要支持应用的高可用性访问时,多层次的持续性是必须的。幸运的是,AWS提供了三种很好的服务可以结合起来使用,以解决地区,区域和实例层面的 问题。通过添加像NewRelic这样的第三方服务来监控应用程序可以为你的业务提供各种警报并可以自动修复服务以减少停机时间。

可用性在公有云的范畴意味着公司必须确保自己的服务宕机时间最少。对于很多web规模的企业来说连接的丢失意味着客户的丢失。要确保可用性,重要的是在故 障变成彻底断电以前就要发现并想法减轻。使用AWS,开发人员可以采取三管齐下的方法来提高持续性,通过使用如Amazon Route 53,弹性负载均衡和自动扩展组这样的工具。

直接请求过程,例如视频回放的请求,不是由事件驱动的。基于这个原因,并行化在这里不像在其他后端进程那样适用。对于那些需要立刻作出反应的直接请求,开 发人员必须提供高可用性的支持。如果用户在尝试播放视频时得到一个“500错误,服务器不可用”的回应,该业务将有可能失去用户。

企业可以很轻松地发布一整夜维护的声明并期待客户能够接受这段时间内将不能访问服务的日子已经过去了。如果一个业务想要提供99.999%的正常运行时间,那么一个月的停机时间大约只能有40分钟。

为了实现这种AWS可用性,开发人员必须能预见到错误-而不只是避免错误。开发人员必须有一个适当的流程,可以从任何形式的破坏性状况下恢复,他们必须能够处理所有类型的网络和区域问题。他们还需要有位于靠近国际客户区域地点的服务器并能将客户路由到正确的地理位置。

开发人员应该关注三个层面来实现全球AWS可用性。在最顶层是Amazon Route 53。在地区层面,开发者可以使用弹性负载均衡(ELB),然后在域层面,他们需要增加自动扩展组。

图1:典型的AWS高可靠性架构

该架构保护资源避免几个潜在的问题,包括地理问题,通过直接引导用户到离其最近的网络位置,用ELB解决单独域的问题,使用自动扩展组解决单独服务器的问题。开发人员可以配置自动扩展组来自动杀掉未响应ELB健康检查的任何实例。

经受住区域性亚马逊Web服务问题的考验

然而所有这些都假定AWS不会有一整个区域的断电。但并非总是如此,事实上,有很多记录在案的事件表明,亚马逊曾经有过某个具体服务的一整个区域断电,包 括DynamoDB和弹性计算云。如果亚马逊在一个地区出现问题,一个业务可能会失去那片地区的所有客户并需要手动将流量重定向到另一个区域,除非你添加 了Route 53健康检查。

支持地理路由和健康检查很简单,只要设置一个在故障发生时可以切换到其他端点的区域端点。例如,如果一个网站是example.com,它可以设置us- east.example.com,us-west.example.com和eu-west.example.com这三个端点。然后配置 Example.com使用在地理位置上最近的端点。但其中每个端点将被配置为使用这三个ELB之一,优先使用最近的并同时通过健康检查来转到其它端点 上。

图2:在这张Route 53配置图中,黑色代表最理想的选择,蓝色代表次要选择,红色是第三选择。

图2显示了一个Route 53区,根据地理位置配置了三个独立的端点。如果我们被导向美东端点,则***是美东负载平衡器。倘若负载平衡器不可用,它会尝试使用美西的负载平衡器。如 果美西的ELB也宕了,则会转到欧西地区。如果这三个地区都宕掉了,那么你的麻烦就很大了。在Route 53的层面适当配置健康检查将有助于减少整个区域出故障时的宕机时间。

这就是所谓的增加持续性-预期到个别的区域会断电,并有一个用于恢复服务的计划。但验证和支持每个区域的个体可用性很重要。例如,如果整个区域发生故障,其他区域仍然应该能够不受任何影响的工作。这可以通过使用数据库复制达到。

幸运的是,亚马逊已经在DynamoDB上支持跨地区复制。很多其他的数据库也支持主主复制方案,这样可以在出现问题时转到另一个域来支持区域隔离和持续性。

当开发者需要支持应用的高可用性访问时,多层次的持续性是必须的。幸运的是,AWS提供了三种很好的服务可以结合起来使用,以解决地区,区域和实例层面的 问题。通过添加像NewRelic这样的第三方服务来监控应用程序可以为你的业务提供各种警报并可以自动修复服务以减少停机时间。

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/263917.html<

(0)
管理的头像管理
上一篇2025-05-04 19:10
下一篇 2025-05-04 19:12

相关推荐

  • 服务器流量异常时怎么排查是不是被攻击,是什么原因?

    当服务器流量异常时,首先通过带宽监控、连接数分析和异常流量特征判断是否被攻击,然后采取相应处置措施,识别流量异常的常见信号你可能会遇到这种情况:某天服务器突然响应变慢,或者网站打不开,甚至远程连接都被中断,流量异常通常会在几个方面暴露出来,早期发现能减少损失,带宽占用飙升使用 sar -n DEV 1 5 或……

    2026-07-27
    0
  • 国内访问美国服务器太慢怎么办,为什么访问速度慢

    优化国内访问美国服务器速度,核心在于组合使用CDN边缘节点缓存、优质国际线路(如CN2 GIA)和TCP协议层优化,同时选择具备持牌自营机房和跨境网络资质的专业服务商,为什么国内访问美国服务器延迟居高不下物理距离是首要因素,中美海底光缆总长约1.3万公里,信号往返至少需要120毫秒,但实际延迟往往超过200毫秒……

    2026-07-27
    0
  • 服务器域名解析失败怎么排查,是什么原因造成的?

    服务器域名解析失败的根本原因在于DNS系统无法将域名正确转换为IP地址,排查应遵循从客户端到服务端的顺序:先检查本地网络和DNS缓存,再验证域名解析记录和权威服务器状态,第一步:检查本地网络与DNS设置测试网络连通性先确认你的设备是否正常联网,打开命令提示符或终端,输入ping 8.8.8.8,如果返回回复数据……

    2026-07-27
    0
  • 站群服务器怎么设置不同环境配置,有哪些注意事项?

    站群服务器设置不同的环境配置,核心在于通过虚拟化或容器化技术实现站点隔离,再结合Web服务器配置为每个站点分配独立的PHP版本、数据库及运行参数,从而满足多样化需求,为什么站群服务器需要环境隔离?不同CMS依赖的PHP版本差异明显,例如WordPress推荐PHP 7.4以上,而Drupal 7仍基于PHP 5……

    2026-07-27
    0
  • 站群服务器如何批量管理更高效,有哪些管理技巧?

    站群服务器批量管理想提效,自动化是唯一出路,通过统一配置管理工具与面板系统,结合服务商提供的底层基础设施支持,能将运维效率提升数倍,批量管理的核心痛点与解决思路多台站群服务器分散管理,最常见的问题就是重复劳动,每次软件更新、配置修改、安全加固,都需要逐台登录操作,不仅耗时,还容易漏掉某台机器,更头疼的是,一旦某……

    2026-07-27
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注