Copied


NVIDIA NeMo Switchyard 让 AI 模型路由更智能

realtime news   Aug 11, 2026 14:03 1 Min Read


NVIDIA 发布了 NeMo Switchyard,这是一款开创性的工具,旨在通过智能任务路由优化 AI 代理的工作负载。该系统使开发者能够在不必为每次模型选择重建应用的情况下,平衡模型能力、成本和延迟。这一公告于 2026 年 8 月 11 日发布,将 NeMo Switchyard 定位为增强大型语言模型(LLM)和其他 AI 系统效率的关键组件。

NeMo Switchyard 解决了 AI 工作流中的一个关键挑战:不同的任务通常需要不同的模型。例如,一个代码代理可能会依赖高性能模型进行初始代码探索,但在处理常规任务时切换到更小、更具成本效益的模型。将所有请求发送到单一模型,特别是最强大的模型,可能会不必要地提高成本并增加延迟。Switchyard 动态地将每个任务路由到最适合的模型,利用无需调优和可调优的路由算法来优化性能。

NeMo Switchyard 的工作原理

从核心上看,NeMo Switchyard 充当一个控制层,评估传入请求并根据任务需求将其路由到合适的模型。它可以无缝集成到现有的 AI 工作流中,并支持多种路由方法,包括:

  • 阶段路由器: 根据任务的阶段调整模型的使用,在复杂步骤中优先使用高能力模型,而在常规工作中使用较小的模型。
  • 升级路由器: 从低成本模型开始,只有在遇到困难时才升级到更强大的模型,从而降低整体成本。
  • 可调优路由器: 从特定工作负载的数据中学习,预测哪个模型可以最好地平衡准确性、成本和延迟。

该工具还具有与提供商无关的 API,支持与 OpenAI 和 Anthropic 等流行平台的集成。通过维护会话状态和实现无缝交接,开发者可以在不被锁定到特定模型或提供商的情况下确保一致的性能。

实际影响和性能

早期基准测试突出了 NeMo Switchyard 的潜力。例如,NVIDIA 与 LangChain 合作,在其 Nemotron 3.5 Lightning 和 Claude Opus 4.8 模型之间路由任务。这将成本降低了 74%,而准确性仅下降了 6 个百分点。同样,Cognition 在其 Devin Desktop 代码代理中实施的分阶段路由在成本降低 28% 的情况下实现了接近前沿的性能。

根据任务复杂性动态分配资源的能力,对希望优化 AI 投资的企业有着直接的影响。金融、医疗和芯片设计等行业已经在探索整合。例如,Ramp 正在使用 Switchyard 优化其金融软件工程工作流,而 Cadence 已将其集成到其芯片设计的形式验证工具中。

重要性

随着 AI 系统的日益复杂,能够在专业和前沿模型之间高效路由任务变得至关重要。除了成本节约,NeMo Switchyard 还为开发者提供了操作灵活性,使他们能够在不大幅调整基础设施的情况下适应变化的需求。

NVIDIA 在 AI 代理工具领域的更广泛布局,包括最近扩展的用于生命科学的 BioNeMo Agent Toolkit 和用于工程任务的 PhysicsNeMo,突显了其主导 AI 软件堆栈的战略。NeMo Switchyard 通过为可扩展、高效的 AI 代理操作提供路由支撑,补充了这些努力。

如何开始使用

NeMo Switchyard 是开源的,可在 GitHub 上获取。开发者可以将其集成到现有工具中,或构建针对特定用例量身定制的路由解决方案。凭借对 Python 安装的支持和灵活的配置选项,已经使用 LLM 工作流的团队可以轻松采用。

对于希望优化 AI 基础设施的企业和开发者而言,NVIDIA 的 NeMo Switchyard 提供了一个面向未来的解决方案,以在日益复杂的 AI 环境中管理成本、性能和可扩展性。


Read More