Anyscale 推出针对 AI 工作负载的 GPU 健康可观测性功能
开源 Ray 框架背后的公司 Anyscale 推出了 GPU 健康可观测性,这是一种旨在弥合 GPU 硬件监控与机器学习(ML)工作负载之间差距的新工具。该功能于 2026 年 8 月 25 日发布,旨在通过将硬件信号直接集成到工作负载管理工具中,减少大规模 AI 训练和推理任务中的故障。
GPU 故障是 AI 团队的常见痛点。诸如 XID 错误或 ECC 内存问题之类的错误通常会默默地降低工作负载效率,迫使工程师在多个工具中手动排查问题。Anyscale 的新可观测性层通过将 GPU 健康指标(如内存错误和 SM 时钟速度)与特定的 Ray 作业和工作区实时关联起来,消除了这种低效现象。
为什么这对 AI 团队来说是一个游戏规则改变者
传统的 GPU 健康工具(如 NVIDIA 的 DCGM)提供了原始的硬件指标,但缺乏与工作负载相关的上下文信息。Anyscale 的方法将这些信号与运行在受影响 GPU 上的 ML 作业的元数据结合起来。例如,工程师不再只是看到通用的“GPU 内存使用量:38GB”,而是可以确定导致问题的具体工作负载或节点。这将调试时间从数小时缩短到几分钟。
该平台还将硬件遥测、任务故障和集群健康状况整合到一个“单一视图”中。对于管理数百个 Kubernetes 集群中的 GPU 的团队来说,这种整合尤为重要,因为单个硬件问题很容易被汇总指标淹没。
它的工作原理
Anyscale 的 GPU 健康可观测性基于 DCGM 构建,并无缝集成到 KubeRay 环境中。通过在设置中添加简单的配置,用户可以将 GPU 健康指标转发到 Anyscale,在那里它们会被自动丰富并与相关的工作负载信息一起显示。对于虚拟机,该集成是原生的,无需额外步骤。
该工具提供了两种主要视图:
- 集群级视图:平台操作员可以监控整个集群的 GPU 健康状况,根据节点类型或工作负载分组,以快速识别故障节点。
- 作业级视图:ML 工程师在调试失败的作业时,可以直接追溯到 GPU 层,识别硬件故障(如 NVLink 错误),无需浪费时间在无关的调试路径上。
战略背景
此次发布正值 Anyscale 在 AI 基础设施市场加强定位之际,此前该公司于 2026 年 7 月被 Nscale 收购。此举与公司成为全栈 AI 云提供商的更广泛目标一致。通过 GPU 健康可观测性,Anyscale 正在解决一个关键的操作痛点,提高其对管理复杂云环境工作负载的企业 AI 团队的吸引力。
随着 AI 工作负载规模和复杂性不断增长,减少停机时间和调试时间已成为基础设施提供商的竞争优势。通过将 GPU 健康数据直接集成到其托管的 Ray 环境中,Anyscale 不仅提高了可观测性,还实现了更好的容错能力和更高的作业可靠性。
接下来的计划
Anyscale 计划进一步扩展 GPU 健康可观测性功能,包括更深入的 Kubernetes 集成和增强的容错功能。对于有兴趣提前访问的团队,该工具目前提供私人预览版。