NVIDIA Dynamo 的 Shadow Engine 将 LLM 恢复时间缩短至 7 秒
NVIDIA 发布了 Shadow Engine 恢复功能,这是其 Dynamo 推理框架中的一项突破性功能,可在仅仅 7.3 秒内实现大语言模型 (LLM) 推理的恢复。这相比传统的冷启动恢复时间(近五分钟)提升了近 39 倍。这一公告在 NVIDIA 的开发者博客中发布,展示了对管理大规模生成式 AI 工作负载的企业 AI 基础设施的关键进步。
LLM 推理过程以资源密集著称,需要大量 GPU 内存 (HBM) 和计算能力。当某个进程因可恢复的软件故障或瞬态错误而失败时,传统的恢复路径需要冷启动。这意味着需要重新加载模型权重、重新编译内核并重新初始化 CUDA 图形,这可能会导致服务质量中断数分钟。NVIDIA 的 Shadow Engine 恢复通过在与活动引擎相同的 GPU 上维护完全初始化的备用引擎,从而绕过了这些瓶颈,使其能够在几秒钟内接管。
Shadow Engine 恢复的工作原理
Shadow Engine 恢复的核心是 NVIDIA 的 GPU 内存服务 (GMS),它将 GPU 内存与活动引擎的 CUDA 上下文分离。通过使用持久内存模型,即使活动引擎失败,权重也会保留在 HBM 中,从而使备用引擎能够立即映射这些内存。备用引擎预先初始化了关键组件,例如 CUDA 图形和 NCCL 通信器,使其能够无缝接管工作负载,而无需完全重启的延迟。
在基准测试中,NVIDIA 使用 GLM-5.2(一种大规模 LLM 部署)测量了 Shadow Engine 恢复的影响。当一个工作进程被故意终止时,Shadow Engine 在 7.3 秒内恢复了服务,而冷启动则需要 283 秒。这将首次令牌时间 (TTFT) 从 23.8 秒显著减少到 1.3 秒,同时每用户每秒解码速率从基线配置中的 12 个令牌提高到 46 个令牌。
对 AI 工厂的影响
这一增强功能使 NVIDIA Dynamo 成为大规模“AI 工厂”的关键基础设施解决方案,在这些工厂中,最大化 GPU 利用率和最小化停机时间至关重要。随着生成式 AI 的快速普及,企业需要强大的系统来处理大规模并行工作负载,同时将中断降至最低。Shadow Engine 恢复通过在故障期间提供弹性并提升整体吞吐量和效率,满足了这一需求。
作为一个开源项目,NVIDIA Dynamo 在 2025 年首次亮相,很快就成为了扩展 LLM 和推理模型的核心。它支持主要的 AI 后端,如 TensorRT-LLM、vLLM 和 PyTorch,并能无缝集成到 Kubernetes 环境中。Shadow Engine 恢复目前作为预览功能提供,计划在未来更新中扩展其功能,包括支持键值 (KV) 缓存共享。
市场背景
在 AI 基础设施需求激增的背景下,NVIDIA 专注于推理优化。该公司的 AI 专属硬件和软件解决方案推动其市值在 2026 年 8 月 25 日达到 5.2 万亿美元。NVIDIA 的股价在过去 24 小时内上涨 2.19%,交易价格为 213.05 美元,反映出投资者对其 AI 创新的信心。
Shadow Engine 恢复补充了 NVIDIA 更广泛的战略,旨在主导 AI 基础设施领域。通过解决 LLM 部署中最持久的挑战之一——推理失败期间的停机时间——NVIDIA 巩固了其作为可扩展、容错 AI 系统首选供应商的地位。
下一步是什么?
NVIDIA 计划在未来几个月内扩展 Shadow Engine 恢复的功能,目前正在开发的功能包括 KV 缓存传递。希望测试此功能的企业可以从 NVIDIA 的 Kubernetes 快速入门指南开始,并使用提供的 vLLM 故障切换示例进行部署。随着生成式 AI 工作负载的持续增长,像 Shadow Engine 恢复这样的解决方案将对维护服务级协议 (SLA) 并高效扩展 AI 基础设施至关重要。