详解什么是 Oracle RAC 脑裂

什么是脑裂?

裂脑通常用于描述集群中的两个或多个节点彼此失去连接但随后继续彼此独立运行(包括获取逻辑或物理资源)的场景,错误假设其他进程(es ) 不再运作或使用上述资源。简单来说,“大脑分裂”意味着有 2 个或更多不同的节点集或“队列”,两个队列之间没有通信。

例如:假设在以下情况下有 3 个节点。1. 节点 1,2 可以相互通信。2. 但是 1 和 2 不能和 3 对话,反之亦然。然后有两个同类群组:{1, 2} 和 {3}。

脑裂发生的原因

脑裂事件后的最大风险是破坏系统状态的可能性。损坏的三个典型原因:1. 在发生裂脑事件之前曾经合作的进程独立地修改相同的逻辑共享状态,从而导致系统状态视图发生冲突。这通常被称为“多主机问题”。2. 在Split-Brain 事件之后接受新请求,然后在可能损坏的系统状态上执行(因此可能进一步损坏系统状态)。3. 当分布式系统的进程“重新加入”在一起时,它们可能对系统状态或资源所有权有冲突的看法。在解决冲突的过程中,信息可能会丢失或损坏。

简单来说,在脑裂的情况下,从某种意义上说,有两个(或更多)独立的集群在同一个共享存储上工作。这有可能导致数据损坏。

集群件如何解决“脑裂”的情况?

在脑裂的情况下,投票磁盘将用于确定哪些节点存活以及哪些节点将被驱逐。共同投票结果将是:

  • 具有更多集群节点的组(队列)存活
  • 如果每个组中可用的节点数量相同,则具有较低节点成员的组(队列)将存活。
  • 已经进行了一些改进,以确保负载较低的节点在系统负载高引起驱逐的情况下仍然存在。

通常,当发生裂脑时,会在 ocssd.log 中看到类似以下的消息:

[ CSSD]2011-01-1223:23:08.090 [1262557536] >TRACE: clssnmCheckDskInfo: Checkingdiskinfo...
[ CSSD]2015-01-1223:23:08.090 [1262557536] >ERROR: clssnmCheckDskInfo: Abortinglocalnodetoavoidsplitbrain.
[ CSSD]2015-01-1223:23:08.090 [1262557536] >ERROR: : mynode(2), Leader(2), Size(1) VSNode(1), Leader(1), Size(2)
[ CSSD]2015-01-1223:23:08.090 [1262557536] >ERROR:
###################################
[ CSSD]2015-01-1223:23:08.090 [1262557536] >ERROR: clssscExit: CSSDaborting
###################################

以上消息表明从节点 2 到节点 1 的通信不工作,因此节点 2 只能看到 1 个节点,但节点 1 工作正常,它可以看到集群中的两个节点。为避免脑裂,节点 2 自行中止。

为确保数据一致性,RAC 数据库的每个实例都需要与其他实例保持心跳。心跳由 LMON、LMD、LMS 和 LCK 等后台进程维护。这些进程中的任何一个遇到 IPC 发送超时都会导致通信重新配置和实例驱逐以避免脑裂。控制文件与集群件层中的投票磁盘类似,用于确定哪些实例存活以及哪些实例驱逐。投票结果类似于集群件投票结果。结果,将驱逐 1 个或多个实例。

实例警报日志中的常见消息类似于:

alertlogofinstance1:
---------
MonDec0719:43:052011
IPCSendtimeoutdetected.Sender: ospid26318
Receiver: inst2binc554466600ospid29940
IPCSendtimeoutto2.0inc8formsgtype65521fromopid20
MonDec0719:43:072011
Communicationsreconfiguration: instance_number2
MonDec0719:43:072011
Tracedumpingisperformingid=[cdmp_20091207194307]
Waitingforclusterwaresplit-brainresolution
MonDec0719:53:072011
Evictinginstance2fromcluster
Waitingforinstancestoleave:
2
...
alertlogofinstance2:
---------
MonDec0719:42:182011
IPCSendtimeoutdetected. Receiverospid29940
MonDec0719:42:182011
Errorsinfile
/u01/app/oracle/diag/rdbms/bd/BD2/trace/BD2_lmd0_29940.trc:
Tracedumpingisperformingid=[cdmp_20091207194307]
MonDec0719:42:202011
Waitingforclusterwaresplit-brainresolution
MonDec0719:44:452011
ERROR: LMS0 (ospid: 29942) detectsanidleconnectiontoinstance1
MonDec0719:44:512011
ERROR: LMD0 (ospid: 29940) detectsanidleconnectiontoinstance1
MonDec0719:45:382011
ERROR: LMS1 (ospid: 29954) detectsanidleconnectiontoinstance1
MonDec0719:52:272011
Errorsinfile
/u01/app/oracle/diag/rdbms/bd/BD2/trace/PVBD2_lmon_29938.trc
(incident=90153):
ORA-29740: evictedbymember0, groupincarnation10
Incidentdetailsin:
/u01/app/oracle/diag/rdbms/bd/BD2/incident/incdir_90153/BD2_lmon_29938_i90153.trc

在上面的示例中,实例 2 LMD0 (pid 29940) 是 IPC 发送超时的接收方。​

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/228030.html<

(0)
管理的头像管理
上一篇2025-04-18 02:55
下一篇 2025-04-18 02:56

相关推荐

  • 站群服务器和普通服务器到底哪个更适合GEO,怎么选?

    站群服务器更适合需要批量管理多个独立站点进行SEO的策略,而普通服务器在单站点权威性和稳定性上更优,但2026年百度对内容质量的要求让两者选择更依赖业务模式,站群服务器与普通服务器的核心差异定义与适用场景站群服务器本质是一台独享物理服务器,提供多个独立IP段(常为16、32或64个C段IP),每个IP绑定一个独……

    2026-07-28
    0
  • 物理服务器和云服务器做站群到底选哪个,哪个更稳定?

    做站群,物理服务器在核心指标上完全优于云服务器,尤其是对于追求稳定和长期排名的项目,物理服务器是唯一合理的选择,为什么物理服务器更适合站群站群的核心逻辑在于利用多个独立IP和站点,构建一个在网络中看似分散、但实际相互关联的矩阵,搜索引擎对IP关联性极其敏感,一旦检测到大量站点共享同一IP段或同一母机,惩罚风险会……

    2026-07-28
    0
  • 国内高防服务器哪家防御真实靠谱,怎么选?

    国内高防服务器哪家防御真实靠谱?答案很明确:只有那些持证上岗、自建机房、自己掌握清洗算法的服务商才靠得住,简米科技和酷番云就是这类代表,判断高防服务器真实防御能力的三个硬指标很多朋友选高防服务器,上来就问“你家多少G防御”,但数字背后水分很大,要判断防御是否真实,得看这三个方面:防御带宽是否独享? 有些服务商宣……

    2026-07-28
    0
  • 裸金属服务器和物理服务器有什么区别?,怎么选?

    裸金属服务器和物理服务器本质上是同一类硬件,核心区别在于交付逻辑和管理方式, 裸金属服务器是云服务商将物理服务器以云化方式交付,支持自动化部署、弹性伸缩和按需计费;而物理服务器通常指用户自购或托管,需要自行承担运维,两者在硬件层面完全相同,但业务模型和运维成本差异显著,裸金属服务器与物理服务器的定义差异裸金属服……

    2026-07-28
    0
  • 做GEO站群选哪家服务器服务商靠谱,怎么选?

    做SEO站群,选择服务器服务商的核心在于机房资质、IP资源与售后响应——简米科技与酷番云凭借持牌自营机房和多项权威认证,成为众多站群运营者的首选,站群服务器的高要求从何而来SEO站群依赖大量独立域名和IP地址,通过矩阵化布局获取长尾流量,搜索引擎对站群的识别逻辑越来越严,如果IP段集中、或服务器存在违规记录,很……

    2026-07-28
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注