简单的方式创建分布式应用程序

简单的方式创建分布式应用程序

作者:somenzz 2021-08-30 20:19:55

开发

前端

分布式 Ray 是基于 Python 的分布式计算框架,采用动态图计算模型,提供简单、通用的 API 来创建分布式应用。使用起来很方便,你可以通过装饰器的方式,仅需修改极少的的代码,让原本运行在单机的 Python 代码轻松实现分布式计算,目前多用于机器学习。

[[420515]]

面对计算密集型的任务,除了多进程,就是分布式计算,如何用 Python 实现分布式计算呢?今天分享一个很简单的方法,那就是借助于 Ray。

什么是 Ray

Ray 是基于 Python 的分布式计算框架,采用动态图计算模型,提供简单、通用的 API 来创建分布式应用。使用起来很方便,你可以通过装饰器的方式,仅需修改极少的的代码,让原本运行在单机的 Python 代码轻松实现分布式计算,目前多用于机器学习。

Ray 的特色:

1、提供用于构建和运行分布式应用程序的简单原语。

2、使用户能够并行化单机代码,代码更改很少甚至为零。

3、Ray Core 包括一个由应用程序、库和工具组成的大型生态系统,以支持复杂的应用程序。比如 Tune、RLlib、RaySGD、Serve、Datasets、Workflows。

安装 Ray

最简单的安装官方版本的方式:

  1. pip install -U ray 
  2. pip install 'ray[default]' 

如果是 Windows 系统,要求必须安装 Visual C++ runtime

其他安装方式见官方文档。

使用 Ray

一个装饰器就搞定分布式计算:

  1. import ray 
  2. ray.init() 
  3.  
  4. @ray.remote 
  5. def f(x): 
  6.     return x * x 
  7.  
  8. futures = [f.remote(i) for i in range(4)] 
  9. print(ray.get(futures)) # [0, 1, 4, 9] 

先执行 ray.init(),然后在要执行分布式任务的函数前加一个装饰器 @ray.remote 就实现了分布式计算。装饰器 @ray.remote 也可以装饰一个类:

  1. import ray 
  2. ray.init() 
  3.  
  4. @ray.remote 
  5. class Counter(object): 
  6.     def __init__(self): 
  7.         self.n = 0 
  8.  
  9.     def increment(self): 
  10.         self.n += 1 
  11.  
  12.     def read(self): 
  13.         return self.n 
  14.  
  15. counters = [Counter.remote() for i in range(4)] 
  16. tmp1 = [c.increment.remote() for c in counters] 
  17. tmp2 = [c.increment.remote() for c in counters] 
  18. tmp3 = [c.increment.remote() for c in counters] 
  19. futures = [c.read.remote() for c in counters] 
  20. print(ray.get(futures)) # [3, 3, 3, 3] 

当然了,上述的分布式计算依然是在自己的电脑上进行的,只不过是以分布式的形式。程序执行的过程中,你可以输入 http://127.0.0.1:8265/#/ 查看分布式任务的执行情况:

那么如何实现 Ray 集群计算呢?接着往下看。

使用 Ray 集群

Ray 的优势之一是能够在同一程序中利用多台机器。当然,Ray 可以在一台机器上运行,因为通常情况下,你只有一台机器。但真正的力量是在一组机器上使用 Ray。

Ray 集群由一个头节点和一组工作节点组成。需要先启动头节点,给 worker 节点赋予头节点地址,组成集群:

你可以使用 Ray Cluster Launcher 来配置机器并启动多节点 Ray 集群。你可以在 AWS、GCP、Azure、Kubernetes、阿里云、内部部署和 Staroid 上甚至在你的自定义节点提供商上使用集群启动器。

Ray 集群还可以利用 Ray Autoscaler,它允许 Ray 与云提供商交互,以根据规范和应用程序工作负载请求或发布实例。

现在,我们来快速演示下 Ray 集群的功能,这里是用 Docker 来启动两个 Ubuntu 容器来模拟集群:

  • 环境 1: 172.17.0.2 作为 head 节点
  • 环境 2: 172.17.0.3 作为 worker 节点,可以有多个 worker 节点

具体步骤:

1. 下载 ubuntu 镜像

  1. docker pull ubuntu 

2. 启动 ubuntu 容器,安装依赖

启动第一个

  1. docker run -it --name ubuntu-01 ubuntu bash 

启动第二个

  1. docker run -it --name ubuntu-02 ubuntu bash 

检查下它们的 IP 地址:

  1. $ docker inspect -f "{{ .NetworkSettings.IPAddress }}" ubuntu-01 
  2. 172.17.0.2 
  3. $ docker inspect -f "{{ .NetworkSettings.IPAddress }}" ubuntu-02 
  4. 172.17.0.3 

然后分别在容器内部安装 python、pip、ray

  1. apt update && apt install python3  
  2. apt install python3-pip 
  3. pip3 install ray 

3. 启动 head 节点和 worker 节点

选择在其中一个容器作为 head 节点,这里选择 172.17.0.2,执行:

  1. ray start --head --node-ip-address 172.17.0.2 

默认端口是 6379,你可以使用 –port 参数来修改默认端口,启动后的结果如下:

忽略掉警告,可以看到给出了一个提示,如果要把其他节点绑定到该 head,可以这样:

  1. ray start --address='172.17.0.2:6379' --redis-password='5241590000000000' 

在另一个节点执行上述命令,即可启动 worker 节点:

如果要关闭,执行:

  1. ray stop 

4、执行任务

随便选择一个节点,执行下面的脚本,修改下 ray.init() 函数的参数:

  1. from collections import Counter 
  2. import socket 
  3. import time 
  4.  
  5. import ray 
  6.  
  7. ray.init(address='172.17.0.2:6379', _redis_password='5241590000000000'
  8.  
  9. print('''This cluster consists o    f 
  10.     {} nodes in total 
  11.     {} CPU resources in total 
  12. '''.format(len(ray.nodes()), ray.cluster_resources()['CPU'])) 
  13.  
  14. @ray.remote 
  15. def f(): 
  16.     time.sleep(0.001) 
  17.     # Return IP address. 
  18.     return socket.gethostbyname(socket.gethostname()) 
  19.  
  20. object_ids = [f.remote() for _ in range(10000)] 
  21. ip_addresses = ray.get(object_ids) 
  22.  
  23. print('Tasks executed'
  24. for ip_address, num_tasks in Counter(ip_addresses).items(): 
  25.     print('    {} tasks on {}'.format(num_tasks, ip_address)) 

执行结果如下:

可以看到 172.17.0.2 执行了 4751 个任务,172.17.0.3 执行了 5249 个任务,实现了分布式计算的效果。

最后的话

有了 Ray,你可以不使用 Python 的多进程就可以实现并行计算。今天的机器学习主要就是计算密集型任务,不借助分布式计算速度会非常慢,Ray 提供了简单实现分布式计算的解决方案。官方文档提供了很详细的教程和样例,感兴趣的可以去了解下。

 

如果有帮助,不妨随手一个关注,每天学点 Python 技术。

 

文章来源网络,作者:管理,如若转载,请注明出处:https://shuyeidc.com/wp/240007.html<

(0)
管理的头像管理
上一篇2025-04-23 16:20
下一篇 2025-04-23 16:22

相关推荐

  • 站群服务器和普通服务器到底哪个更适合GEO,怎么选?

    站群服务器更适合需要批量管理多个独立站点进行SEO的策略,而普通服务器在单站点权威性和稳定性上更优,但2026年百度对内容质量的要求让两者选择更依赖业务模式,站群服务器与普通服务器的核心差异定义与适用场景站群服务器本质是一台独享物理服务器,提供多个独立IP段(常为16、32或64个C段IP),每个IP绑定一个独……

    2026-07-28
    0
  • 物理服务器和云服务器做站群到底选哪个,哪个更稳定?

    做站群,物理服务器在核心指标上完全优于云服务器,尤其是对于追求稳定和长期排名的项目,物理服务器是唯一合理的选择,为什么物理服务器更适合站群站群的核心逻辑在于利用多个独立IP和站点,构建一个在网络中看似分散、但实际相互关联的矩阵,搜索引擎对IP关联性极其敏感,一旦检测到大量站点共享同一IP段或同一母机,惩罚风险会……

    2026-07-28
    0
  • 国内高防服务器哪家防御真实靠谱,怎么选?

    国内高防服务器哪家防御真实靠谱?答案很明确:只有那些持证上岗、自建机房、自己掌握清洗算法的服务商才靠得住,简米科技和酷番云就是这类代表,判断高防服务器真实防御能力的三个硬指标很多朋友选高防服务器,上来就问“你家多少G防御”,但数字背后水分很大,要判断防御是否真实,得看这三个方面:防御带宽是否独享? 有些服务商宣……

    2026-07-28
    0
  • 裸金属服务器和物理服务器有什么区别?,怎么选?

    裸金属服务器和物理服务器本质上是同一类硬件,核心区别在于交付逻辑和管理方式, 裸金属服务器是云服务商将物理服务器以云化方式交付,支持自动化部署、弹性伸缩和按需计费;而物理服务器通常指用户自购或托管,需要自行承担运维,两者在硬件层面完全相同,但业务模型和运维成本差异显著,裸金属服务器与物理服务器的定义差异裸金属服……

    2026-07-28
    0
  • 做GEO站群选哪家服务器服务商靠谱,怎么选?

    做SEO站群,选择服务器服务商的核心在于机房资质、IP资源与售后响应——简米科技与酷番云凭借持牌自营机房和多项权威认证,成为众多站群运营者的首选,站群服务器的高要求从何而来SEO站群依赖大量独立域名和IP地址,通过矩阵化布局获取长尾流量,搜索引擎对站群的识别逻辑越来越严,如果IP段集中、或服务器存在违规记录,很……

    2026-07-28
    0

发表回复

您的邮箱地址不会被公开。必填项已用 * 标注