AI产品库

分布式计算与机器学习框架 · Apache-2.0 许可免费开源;托管与商业支持由 Anyscale 提供,成本取决于自建集群或托管方案。

Ray LogoRay

一个运行时加五个 AI 库的分布式计算框架

官方把它描述为「统一扩展 AI 与 Python 应用的框架」:由一个核心分布式运行时和一组简化机器学习计算的 AI 库组成,可运行在任何机器、集群、云厂商与 Kubernetes 上,并有持续增长的社区集成生态。

深度介绍

Ray详细介绍

🧩

一个核心运行时加五个 AI 库

官方把 Ray 的结构讲得很清楚:底层是一个核心分布式运行时,上面是一组简化机器学习计算的 AI 库——Data(可扩展数据集)、Train(分布式训练)、Tune(可扩展超参调优)、RLlib(可扩展强化学习)与 Serve(可编程服务)。这种分层的好处是各库共享同一套调度与资源管理:数据预处理、训练、调参、强化学习与上线服务可以跑在同一个集群里,而不是各自维护一套作业系统。代价是全家桶体量较大,只用一个库时按需安装对应子包更轻。

🧠

Ray Core 的三个抽象:Task、Actor、Object

核心运行时的编程模型只有三个概念:Task 是无状态函数,提交后在集群中执行;Actor 是有状态的 worker 进程,适合需要保持状态的场景(例如参数服务器、推理引擎实例);Object 是可在集群内访问的不可变值,用来在任务之间传递数据。官方文档说明掌握这三个抽象后,就能把普通 Python 代码改造成分布式程序。实际使用中最需要注意的是对象存储与序列化开销——跨节点的数据传递往往比计算本身更影响性能。

📊

Data 与 Train:把数据与训练都摊到集群上

Ray Data 提供可扩展的数据集抽象,适合大规模数据预处理、特征工程与批推理;Ray Train 负责分布式训练,把训练循环的并行与容错交给框架。官方 README 把这两个库列为 AI 库的前两项,也说明它们是使用频率最高的组合。对已有 PyTorch 训练脚本的团队,常见做法是保留模型代码、把数据加载与分布式启动交给 Ray;这样既复用了既有实现,又获得了弹性扩缩的能力。需要注意的是分布式训练的性能瓶颈通常在存储与网络,配置前应先把数据管线测通。

🎛

Tune 与 RLlib:调参与强化学习

Tune 面向超参搜索,官方定位为可扩展的调参库,支持多种搜索算法与调度策略;RLlib 面向强化学习,提供可扩展的算法实现。两者都构建在同一套运行时之上,因此可以并行占用大量算力而不必自建调度。这类负载的特点是「任务多、单个任务短」,调度与容错能力比单任务性能更重要。落地时的经验是先明确评估预算与早停策略,否则并行度越高越容易在无望的配置上烧掉算力。

🌐

Serve:把模型部署成可扩缩的服务

Ray Serve 提供一个可编程的服务框架,用于部署模型与组合多个模型(例如把预处理、推理与后处理串成一条链路),并按负载扩缩副本。它与训练侧共享同一集群与资源池,这对「训练完直接上线」的流程很实用:权重与依赖不必在另一套系统里重新配置。文档给出的实践路径包括与常见推理引擎及网关的集成。需要注意的是服务侧的扩缩策略、冷启动与资源隔离仍需按业务实测调优,尤其是有状态模型与 GPU 资源碎片化的场景。

🖧

运行环境与运维配套

官方称 Ray 可运行在任何机器、集群、云厂商与 Kubernetes 上,并提到持续增长的社区集成生态;安装方式为一条 pip 命令,另有 nightly 轮子供跟进最新特性。运维侧提供两个配套工具:Ray Dashboard 用于监控应用与集群,Ray Distributed Debugger 用于调试分布式应用。在 Kubernetes 上则可通过 KubeRay 项目部署与编排 Ray 集群。这几项决定了它能否从「本机跑通」走到「生产可用」,建议在正式上线前先把监控与调试链路打通。

⚖️

许可、商业方与采用情况

Ray 以 Apache-2.0 许可开源,由 Anyscale 主导并作为商业化公司提供托管与支持;核验时 GitHub 仓库约有 4.4 万 star。它的定位是「AI 计算引擎」,社区生态里既有数据处理与训练框架的集成,也有推理与服务侧的适配。对选型者而言,需要区分开源项目与托管服务:开源部分可自建,代价是集群运维与升级由自己负责;托管方案省去运维但引入供应商依赖与费用,二者可按团队规模分阶段选择。

🚀

版本节奏与上手建议

发布记录显示 Ray 保持稳定的版本节奏:Ray-2.58.0(2026 年 8 月 12 日)、2.56.1(2026 年 6 月 29 日)、2.55.1(2026 年 4 月 15 日)、2.54.1(2026 年 2 月 19 日)等。上手建议是从单机模式开始:官方文档的安装页与快速上手会先在本机启动一个本地集群,理解 Task/Actor/Object 之后再扩展到真实集群;生产环境则建议直接以 KubeRay 加 Dashboard 起步,避免两套部署方式来回迁移。

产品特点

核心功能与独有价值

01

同一运行时覆盖训练、调参、强化学习与服务

核心运行时之上提供 Data、Train、Tune、RLlib 与 Serve 五个 AI 库,五类负载共享同一套调度与资源管理,避免为每个环节各建一套作业系统。

02

只有三个核心抽象:Task、Actor、Object

无状态函数、有状态进程与跨集群不可变值构成了 Ray Core 的全部编程模型,官方文档称掌握这三者即可把 Python 程序改造成分布式程序。

03

随处可跑:本机、集群、云与 Kubernetes

官方称 Ray 可运行在任何机器、集群、云厂商与 Kubernetes 上;KubeRay 负责集群编排,并有 Dashboard 与 Distributed Debugger 两个运维配套工具。

04

Apache-2.0 开源,商业化由 Anyscale 提供

项目以 Apache-2.0 许可开源、由 Anyscale 主导,团队可在自建集群与托管服务之间分阶段选择,避免一开始就被单一供应商锁定。

最近动态

重要更新

Ray-2.58.0:仲夏版本发布

发布记录显示 Ray-2.58.0 于 2026 年 8 月 12 日发布。项目保持约每两个月一个次版本的节奏,升级前建议阅读对应版本的发布说明并在测试集群验证现有作业。

Ray-2.56.1:年中小版本

Ray-2.56.1 于 2026 年 6 月 29 日发布,属于 2.56 系列的修订版本。这类补丁版本通常以修复与稳定性改进为主,生产环境可按常规灰度流程升级。

Ray-2.55.1:春季修订版本

Ray-2.55.1 于 2026 年 4 月 15 日发布。核验时的版本序列为 2.53.0(2025 年 11 月)、2.54.1(2026 年 2 月)、2.55.1、2.56.1 与 2.58.0,整体节奏稳定。

Ray-2.53.0:2.5x 系列的起点

Ray-2.53.0 于 2025 年 11 月 29 日发布,是核验范围内较早的一个次版本。由于 Ray 的库与运行时耦合较紧,跨多个次版本升级时建议整体同步升级各子包,避免版本混用导致调度或序列化异常。

产品总结

Ray 是由 Anyscale 主导的开源分布式计算框架,官方把它描述为「统一扩展 AI 与 Python 应用的框架」:由一个核心分布式运行时和一组 AI 库组成,目标是让同一套基础设施承载从数据处理到在线服务的各类机器学习负载。项目以 Apache-2.0 许可开源,核验时 GitHub 仓库约有 4.4 万 star,版本节奏稳定,最新记录为 Ray-2.58.0(2026 年 8 月 12 日),此前有 2.56.1(2026 年 6 月)、2.55.1(2026 年 4 月)与 2.54.1(2026 年 2 月)等版本。 它的结构分两层。核心运行时只提供三个抽象:Task(无状态函数,提交后在集群执行)、Actor(有状态 worker 进程,适合参数服务器或推理实例这类场景)与 Object(可在集群内访问的不可变值,用于任务间传数据);官方文档称掌握这三者即可把普通 Python 程序改造成分布式程序。其上是五个 AI 库:Data 提供可扩展数据集,用于大规模数据预处理与批推理;Train 负责分布式训练;Tune 面向超参搜索;RLlib 提供强化学习算法;Serve 用于部署可编程、可扩缩的模型服务。五者共享同一套调度与资源管理,因而训练、调参与上线可以在同一个集群里完成。 运行环境方面,官方称 Ray 可运行在任何机器、集群、云厂商与 Kubernetes 上,安装只需一条 pip 命令(另有 nightly 轮子),并配套 Ray Dashboard 用于监控应用与集群、Ray Distributed Debugger 用于调试分布式程序;在 Kubernetes 上可通过 KubeRay 项目部署与编排集群。官方同时提到围绕它的社区集成生态在持续增长,涵盖数据处理、训练框架与推理服务等方向。 使用前需要注意:Ray 属于全家桶式框架,只用到单个库时按需安装对应子包更轻;跨节点的对象传输与序列化往往是性能主要开销,调优前应先测量数据搬运;分布式训练的实际瓶颈通常在存储与网络,配置前把数据管线测通更省时间;服务侧的扩缩策略、冷启动与 GPU 资源碎片化需要按业务实测;该框架由 Anyscale 主导并提供托管方案,自建与托管在运维成本和供应商依赖上各有取舍,建议按团队规模分阶段选择。

产品类型
分布式计算与机器学习框架
支持平台
Python 库(pip install ray / Ray Core(Task、Actor、Obje / Ray Data(可扩展数据集) / Ray Train(分布式训练) / Ray Tune(超参调优) / Ray RLlib(强化学习) / Ray Serve(可编程服务) / KubeRay 与多云 / 本地集群
资费模式
Apache-2.0 许可免费开源;托管与商业支持由 Anyscale 提供,成本取决于自建集群或托管方案。

核验信息

参考文章与数据来源

本页事实来自 Ray 官方渠道:GitHub 仓库 README(「统一扩展 AI 与 Python 应用」定位、核心运行时与五个 AI 库的分层说明、Task/Actor/Object 三个抽象、Ray Dashboard 与 Distributed Debugger、可运行环境与社区集成生态、pip 安装与 nightly 轮子说明)与许可文件(Apache-2.0)、发布页版本与日期,以及官方站点与官方文档(安装说明、Data、Train、Tune、RLlib、Serve 各库入口)和 KubeRay 仓库。star 数、版本与功能核验于 2026 年 9 月 22 日,请以官方文档与发布说明为准。

  1. 官网Ray 官网
  2. 其他Ray 官方仓库
  3. 官方文档官方文档
  4. 官方文档官方文档 · 安装说明
  5. 官方文档官方文档 · Ray Data
  6. 官方文档官方文档 · Ray Train
  7. 官方文档官方文档 · Ray Tune
  8. 官方文档官方文档 · Ray Serve

用户体验调查

Ray介绍页面对您是否有帮助?