Copied


NVIDIA Jetson 支持本地 AI,使用紧凑型模型

realtime news   Sep 04, 2026 18:48 1 Min Read


在边缘运行先进的 AI 模型变得更加容易。NVIDIA 的 Jetson 平台现在能够部署紧凑型、多步骤推理模型,如 Nemotron 3.5 Lightning 和 Qwen3.8-27B,从而解锁之前需要大型数据中心基础设施才能实现的本地 AI 功能。

直到最近,边缘 AI 开发者仍然面临艰难的抉择:通过集中化数据中心进行推理,或者满足于有限的设备内功能。这种依赖性导致了更高的成本、更大的延迟以及潜在的数据安全风险。然而,随着模型压缩和硬件优化的进步,NVIDIA Jetson 模块(如 AGX Thor 和 AGX Orin)现在可以本地运行推理模型,大幅减少对云基础设施的依赖。

为什么这很重要

能够直接在边缘设备上运行推理和自主 AI 开启了机器人、工业自动化以及现场故障排除等真实世界的应用。例如,自动驾驶汽车的车内助手、制造业中的实时异常检测,以及在偏远或连接受限环境中运行的 AI 驱动机器人。

NVIDIA 的 Jetson 系列已经是边缘 AI 的领导者,包括 Jetson AGX Orin 和其旗舰产品 Jetson AGX Thor。后者利用 NVIDIA 的 Blackwell GPU 架构,特别适合高强度 AI 任务,得益于其对多实例 GPU (MIG) 技术的支持以及 JetPack SDK 的优化。

推动边缘 AI 采用的关键创新

两项关键技术使这些突破成为可能:NVFP4 量化和推测解码。NVFP4 降低了内存和计算需求,而推测解码通过同时评估多个选项加快了 token 的生成速度。这两种方法结合,使推理吞吐量提高了最多 6.28 倍,如 NVIDIA 基准测试所示。

模型的架构也发挥了作用。例如,Nemotron 3.5 Lightning 采用专家混合 (MoE) 设计,每个 token 只激活其 300 亿参数中的 30 亿,使其比像 Qwen3.8-27B 这样的密集模型更快且更高效,后者在每个 token 上处理其全部的 270 亿参数。这使得 Nemotron 成为需要快速响应时间的工作负载的理想选择,而 Qwen 更适合需要更高计算强度决策的任务。

对开发者和企业的影响

这些进步意味着在边缘部署 AI 的企业可以减少对云服务的依赖,降低运营成本并通过保持数据本地化来提高安全性。使用 Jetson 平台的开发者可以利用 vLLM 和 llama.cpp 等工具有效部署这些模型,同时还可以使用 NVIDIA 的 JetPack SDK 进行硬件集成和性能调优。

对于评估部署的专业人士,NVIDIA 建议根据特定工作负载对像 Nemotron 和 Qwen 这样的模型进行基准测试。例如,在实时监控场景中,Nemotron 更快的 token 生成可以简化错误修正和决策验证等流程。

Jetson 和边缘 AI 的下一步是什么?

随着 AI 应用在各行业的快速普及,NVIDIA Jetson 能够本地运行紧凑型高性能模型,使其成为边缘计算的关键推动力。Jetson AGX Thor 的推出,其 Blackwell GPU 架构和扩展的 AI 功能,表明了 NVIDIA 在这一领域推动创新的承诺。

有兴趣利用这些能力的开发者和企业可以探索 NVIDIA 官方教程,学习如何部署生成式 AI 模型和优化推理性能。有了这些基础设施,从测试到部署实际应用的转变现在触手可及。


Read More