Anyscale 将 Ray Core 扩展到 10,000 个节点以支持 AI 工作负载
Anyscale 宣布在扩展 Ray Core(Ray 框架的分布式运行时层)方面取得了重大进展,以支持规模高达 10,000 个节点的 AI 工作负载。这些升级改善了批量推理、强化学习 (RL) 以及训练前/后的任务性能,解决了调度和资源管理中的关键瓶颈。
最新改进中的关键指标包括,在 500 节点集群上,批量推理的端到端性能提高了 23%,Ray Data 的 Shuffle 操作速度提升了 24%,在 2,000 节点时 Actor 启动时间改进了 6.5 倍。值得注意的是,Ray Core 现在可以扩展到在 10,000 节点集群上运行 40,000 个 Actors,这是以前无法实现的里程碑。
这些优化至关重要,因为 Ray 越来越多地成为大规模 AI 系统的基础。例如,分布式训练工作负载通常需要低延迟的 Actor 调度和故障恢复过程,特别是在数据中心中管理受网络拓扑限制的 GPU 时。通过解决这些扩展性挑战,Ray Core 将自己定位为 AI 基础设施的基础工具,特别是在云和混合环境中。
突破瓶颈
历史上,三个主要问题限制了 Ray 的可扩展性:
- 线程之间的锁争用,阻碍了任务吞吐量。
- 管理异步操作的线程过载,延迟了任务调度。
- 依赖过时的资源视图,导致任务分配效率低下。
为了解决这些问题,Anyscale 在 Ray 的全局控制服务 (GCS) 中引入了多线程,减少了系统的空闲负载。拓扑感知工作负载的关键功能——Placement Group 调度,其设置时间从数小时减少到在 10,000 节点时仅需数秒。此外,对 Actor 生命周期管理和资源同步的优化进一步减少了延迟,尤其是在节点故障引起的大规模重启期间。
对 AI 基础设施的战略意义
这些可扩展性提升与 Anyscale 在 2026 年 7 月宣布与 Nscale 达成最终协议后的更广泛战略一致。该公司计划进一步加大对 Ray 的开发力度,优化框架以适应新兴的加速器和数据中心架构,同时在 PyTorch 基金会的管理下保持其开源治理。
这些改进还反映了强调生产级 AI 工作负载的市场趋势。例如,今年早些时候,Google Cloud 和 Anyscale 报告称,在 GKE 上运行的 Ray Serve 的吞吐量提高了多达 5 倍,延迟降低了多达 8 倍,突显了 Ray 在服务大型语言模型 (LLM) 和其他推理密集型应用中的角色。最新的改进使 Ray 在分布式 AI 工作负载中更具竞争力,特别是对于跨 Kubernetes 和混合云环境扩展的组织。
下一步是什么?
随着这些更新已在 Ray 的 nightly 构建中可用,Anyscale 计划进一步投资于 Actor 和 Driver 的扩展性。即将进行的开发包括过渡到更集中化的调度机制,并将 Actor 生命周期管理直接迁移到所有者而非 GCS。这些更改旨在进一步增强可扩展性并降低在超大规模集群中的工作负载延迟。
随着 AI 工作负载的复杂性和规模持续增长,Ray 能够处理 10,000 节点及以上规模的集群,使其成为下一代 AI 基础设施的重要推动者。用户可以通过 Ray 的 GitHub 仓库和 Slack 频道贡献或测试这些改进。