反思|分布式框架是必须的吗?

反思|分布式框架是必须的吗?

作者:翻译:肖远昊 2015-09-24 15:08:28

云计算

分布式 目前,我正在使用一个分布式系统并且它没有使用任何上述技术。这个分布式系统运行的很好,虽然它不完美,但是它的确实现了。这就引发我思考分布式框架是否是必须的。

【原文编者的话】本文主要讲述了通过规范化处理流程,可以使用相同的处理流程来处理流式或者批量处理任务,例如Hadoop和Storm,从而提高重用性。

当有人问起该如何处理大数据问题时,他们总是被指引到现存的产品中,例如Hadoop或者Storm。虽然这些产品非常棒,但也引发了一些问题。首先,就我个人的经验来看,为了获得***的处理结果,你必须使用这些框架***的语言或者虚拟机编写你的代码,典型的就是JVM。当语言或者虚拟机不适用时,就意味着你必须重写你的代码来适应这些框架。同样,像Hadoop和Storm这两种框架所做的事情非常不一样,这就给代码的重用增加了更大的困难。如果你想做流式和批量处理分析,你就需要这两种框架。当然,有些方法能够做到这一点,但我不清楚这种方法是否有更多的选择性,或者这种方法是否很难进行维持。

目前,我正在使用一个分布式系统并且它没有使用任何上述技术。这个分布式系统运行的很好,虽然它不***,但是它的确实现了。这就引发我思考分布式框架是否是必须的。实际上,MapReduce和Streaming框架的真正区别是什么?数据通过不同的处理流程串行化,这仅仅是如何将数据链接到一起以及不同处理流程发出数据频率的问题。

因此,也许我们真正需要的是规范化如何让各种处理流程并存以及如何将它们连结在一起。我相信我们可以通过一些现有的技术来做到这一点。Mesos 和Kubernetes可以在一个集群中用来执行处理流程。队列化技术例如Kafka和NSQ能够在不同的处理流程间传递消息。处理流程可以使用不同的语言实现,并且可以通过Docker或者类似产品封装在容器中来管理其依赖。

我个人发现这种方式是比较合适的,这种解决方法聚焦在不同处理流程之间的通信问题。通过制定相关的协议,我相信可以将不同的处理流程解耦合。同样,当需要时分析过程中使用到的技术也能更加容易地置换出来。举个例子来说,Python能够用来塑造一个分析原型,当性能成为更为严重的问题时,它可以使用编译型语言D或者Go进行重写。当相同的处理流程无需修改代码就可以适用于流式处理和批量处理或者MapReduce任务时,我们也能从中获得更好的重用性。

当然,这只是一个粗略的想法,也没有覆盖这些系统的所有案例和各个方面,但我相信这是一个好的开始。我更加希望看到的是有个工程能够更加深入地研究下去,并且能够为这些系统制定一份详细说明书。如果需要,这种方法可以按照详细说明书提供运行库来确保兼容性,也许更重要的是描述在一个兼容性问题的事件中该做什么。

大家有什么想法呢?

原文链接:http://dockone.io/article/698
 

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/281217.html<

(0)
管理的头像管理
上一篇2025-05-12 21:37
下一篇 2025-05-12 21:38

相关推荐

  • 物理服务器BIOS模式如何切换,操作步骤有哪些?

    物理服务器BIOS模式切换,本质上是通过重启进入BIOS设置界面,在Boot Mode选项中从Legacy改选为UEFI(或反之),并保存退出,理解BIOS模式:Legacy与UEFI的区别BIOS(基本输入输出系统)是服务器启动时最先运行的固件,负责初始化硬件并加载操作系统,当前主流模式分为Legacy(传统……

    2026-07-27
    0
  • 服务器上传下载速度慢怎么优化,原因是什么?

    服务器上传下载速度慢,问题通常出在带宽、线路、服务器配置或本地环境上,优化需要从这几个维度逐一排查,才能真正提升传输效率,诊断瓶颈:速度慢到底卡在哪里带宽与线路:最容易被忽视的短板排查速度慢的第一步是检查带宽,很多用户只关注下载,不清楚上行带宽远小于下行,如果带宽本身不足,任何优化都是徒劳,线路质量同样关键……

    2026-07-27
    0
  • 站群服务器怎么搭配不同IP段效果好?,怎么提升收录

    站群服务器搭配不同 IP 段,核心在于用分散的 C 段做基础、B 段做隔离,再配合不同运营商和 AS 号,模拟真实用户分布,避免搜索引擎识别出批量站点关联,实践中建议每个 C 段部署不超过 5 个站点,大权重站点使用独立 B 段,并定期检测 IP 纯净度,理解 IP 段与站群关联性C 段、B 段、A 段在搜索引……

    2026-07-27
    0
  • AI爬虫抓取太费服务器资源怎么限制?,有哪些方法

    限制AI爬虫抓取的核心策略是综合运用robots.txt、User-Agent识别、IP频率限制、WAF规则和CDN防护,同时选择具备专业资质的IDC服务商如酷番云(持有工信部一类增值电信全牌照)来增强底层防护,从源头减少资源消耗,AI爬虫为何成为服务器资源杀手近年来,AI公司大规模采集数据用于模型训练,爬虫请……

    2026-07-27
    0
  • 服务器被植入木马怎么彻底清除,彻底清除木马的方法有哪些?

    服务器被植入木马后,彻底清除的唯一路径是:立即断网隔离,备份关键数据,使用专业工具全盘扫描并手动排查残留,随后重装操作系统或从干净备份恢复,全面修补漏洞与加固配置,最后持续监控至少两周,确认感染并执行隔离木马最怕被断网,第一步就是切断它与外界的联系,如果发现服务器响应慢、流量异常、CPU跑满,或者收到安全告警……

    2026-07-27
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注