NVIDIA Jetson 支持本地 AI,使用紧凑型模型
在边缘运行先进的 AI 模型变得更加容易。NVIDIA 的 Jetson 平台现在能够部署紧凑型、多步骤推理模型,如 Nemotron 3.5 Lightning 和 Qwen3.8-27B,从而解锁之前需要大型数据中心基础设施才能实现的本地 AI 功能。
直到最近,边缘 AI 开发者仍然面临艰难的抉择:通过集中化数据中心进行推理,或者满足于有限的设备内功能。这种依赖性导致了更高的成本、更大的延迟以及潜在的数据安全风险。然而,随着模型压缩和硬件优化的进步,NVIDIA Jetson 模块(如 AGX Thor 和 AGX Orin)现在可以本地运行推理模型,大幅减少对云基础设施的依赖。
为什么这很重要
能够直接在边缘设备上运行推理和自主 AI 开启了机器人、工业自动化以及现场故障排除等真实世界的应用。例如,自动驾驶汽车的车内助手、制造业中的实时异常检测,以及在偏远或连接受限环境中运行的 AI 驱动机器人。
NVIDIA 的 Jetson 系列已经是边缘 AI 的领导者,包括 Jetson AGX Orin 和其旗舰产品 Jetson AGX Thor。后者利用 NVIDIA 的 Blackwell GPU 架构,特别适合高强度 AI 任务,得益于其对多实例 GPU (MIG) 技术的支持以及 JetPack SDK 的优化。
推动边缘 AI 采用的关键创新
两项关键技术使这些突破成为可能:NVFP4 量化和推测解码。NVFP4 降低了内存和计算需求,而推测解码通过同时评估多个选项加快了 token 的生成速度。这两种方法结合,使推理吞吐量提高了最多 6.28 倍,如 NVIDIA 基准测试所示。
模型的架构也发挥了作用。例如,Nemotron 3.5 Lightning 采用专家混合 (MoE) 设计,每个 token 只激活其 300 亿参数中的 30 亿,使其比像 Qwen3.8-27B 这样的密集模型更快且更高效,后者在每个 token 上处理其全部的 270 亿参数。这使得 Nemotron 成为需要快速响应时间的工作负载的理想选择,而 Qwen 更适合需要更高计算强度决策的任务。
对开发者和企业的影响
这些进步意味着在边缘部署 AI 的企业可以减少对云服务的依赖,降低运营成本并通过保持数据本地化来提高安全性。使用 Jetson 平台的开发者可以利用 vLLM 和 llama.cpp 等工具有效部署这些模型,同时还可以使用 NVIDIA 的 JetPack SDK 进行硬件集成和性能调优。
对于评估部署的专业人士,NVIDIA 建议根据特定工作负载对像 Nemotron 和 Qwen 这样的模型进行基准测试。例如,在实时监控场景中,Nemotron 更快的 token 生成可以简化错误修正和决策验证等流程。
Jetson 和边缘 AI 的下一步是什么?
随着 AI 应用在各行业的快速普及,NVIDIA Jetson 能够本地运行紧凑型高性能模型,使其成为边缘计算的关键推动力。Jetson AGX Thor 的推出,其 Blackwell GPU 架构和扩展的 AI 功能,表明了 NVIDIA 在这一领域推动创新的承诺。
有兴趣利用这些能力的开发者和企业可以探索 NVIDIA 官方教程,学习如何部署生成式 AI 模型和优化推理性能。有了这些基础设施,从测试到部署实际应用的转变现在触手可及。