NVIDIA 如何通过全栈可观测性优化 AI 工厂
NVIDIA (NASDAQ: NVDA) 正在加倍推进全栈可观测性,以应对 AI 基础设施中日益严峻的挑战:在日益复杂的系统中准确找到性能瓶颈的来源。NVIDIA 概述的一个新框架旨在帮助运营商早期检测问题,防止连锁故障,并优化 GPU 等高成本资源的使用。
AI 工作负载涵盖多个层次:计算、网络、存储、编排和应用程序。当性能下降时,根本原因通常深埋在栈中。NVIDIA 的方法通过整合组件间的遥测数据,创建一个可操作的统一系统健康视图。这一点至关重要,因为即使是微小的问题——例如一个 InfiniBand 链接的位错误率升高——也可能导致连锁故障,浪费数小时的 GPU 时间并延迟关键的训练任务。
NVIDIA 可观测性框架的关键要素
NVIDIA 的框架重点关注以下四个优先事项:
- 枚举故障域:这些包括平台健康、GPU 性能、网络结构(InfiniBand 或 Ethernet)、集群/作业管理和推理服务。
- 将工具映射到组件:例如,NVIDIA 的工具如 DCGM、NVSM、UFM 和 BCM 被分配了具体角色,以减少覆盖空白并避免不必要的重叠。例如,DCGM 处理 GPU 的指标,如利用率和功耗,而 UFM 监控 InfiniBand 网络的健康状况。
- 减少遥测噪声:建议运营商专注于与服务级别目标 (SLO) 相关的简明指标。过多的指标可能导致警报疲劳,使团队在噪声中错过关键信号。
- 构建统一仪表盘:使用 Prometheus 和 Grafana 整合来自 GPU、节点和网络结构的信号,从而加快故障排查和根本原因分析。
应对 AI 运营中的复杂性
引入此类框架的需求源于扩展 AI 的运营复杂性。正如 Datadog 的 2026 年报告所指出,部署生产级 AI 系统的公司在保持可靠性、控制成本和提高性能方面面临挑战。NVIDIA 的可观测性栈旨在通过提供端到端的可见性来解决这些痛点,使团队能够识别问题是源自 GPU、网络链接还是编排层。
例如,在 NVIDIA 分享的一个案例中,一个分布式训练任务因单个 InfiniBand 链接的位错误率升高而变慢。尽管问题没有导致硬件离线,但它减慢了一个 GPU 的处理速度,进而延误了整个工作负载。这种“灰色故障”在高度耦合的 AI 系统中变得越来越普遍。
市场影响
NVIDIA 在可观测性方面的创新与其主导 AI 硬件和软件栈的整体战略一致。由于 GPU 价格昂贵且 AI 工作负载快速扩展,减少资源浪费对企业来说是一项财务上的必然要求。NVIDIA 对可观测性的关注还可能增强其生态系统的吸引力,因为像 DCGM 和 UFM 这样的工具将成为基础设施监控的关键。
更广泛的行业趋势也支持这一转变。New Relic 最近宣布了针对 AI 编码助手的新可观测性功能,而学术研究正在逐步聚焦于多层 AI 可观测性的需求。该领域正在演变为一个用于 AI 系统可靠性和性能优化的控制平面。
接下来是什么?
对于大规模部署 AI 的企业来说,NVIDIA 的框架提供了一条减轻运营低效的路线图。关键的下一步包括集成像 DCGM 和 UFM 这样的可观测性工具,减少遥测噪声,并确保仪表盘提供可操作的洞察,而不是用数据压倒运营商。
随着 AI 基础设施成为竞争的主战场,采用强大可观测性实践的公司可能会获得优势——无论是在降低成本方面还是在加速 AI 创新上市时间方面。