Copied


NVIDIA 的生成推荐系统应对扩展性挑战

realtime news   Aug 21, 2026 21:04 1 Min Read


NVIDIA 推出了一系列在生成推荐系统(GRs)方面的新进展,利用大语言模型(LLMs)来应对传统推荐系统的扩展性和复杂性挑战。公司最新的博客文章重点介绍了像 recsys-examples 仓库和 nv-embedding-cache 等解决方案,这些工具旨在解决工业规模部署中数据稀疏、冷启动以及严格的延迟要求等问题。

推荐系统(RecSys)是许多数字体验的基础,从流媒体平台到电子商务网站,但扩展这些系统仍然是一个重要的技术难题。传统的推荐系统通常依赖于基于嵌入的方法,这种方法在处理高维度、稀疏数据时表现不佳——尤其是在拥有数百万商品的目录中。NVIDIA 的生成方法将推荐重新定义为序列建模问题,类似于 LLMs(如 ChatGPT)预测句子中的下一个词。这使得生成推荐系统能够动态建模用户与商品的交互,并更好地处理稀疏数据集。

应对行业挑战

长尾问题是推荐中的一个长期存在的问题,即少数热门商品占据了用户交互的大部分。生成推荐系统通过直接生成推荐,而不是基于预先计算的嵌入对商品进行排序,从而缓解了这一问题。谷歌引入并被 NVIDIA 工具包采纳的技术“语义 ID”,通过分层聚类商品,实现更加多样化和个性化的推荐。

另一个主要障碍是冷启动问题,即新用户或新商品缺乏交互历史。NVIDIA 的生成推荐架构利用语义元数据和动态嵌入,更有效地推断用户偏好,从而减少了历史数据不足的负面影响。这些创新与更广泛的行业趋势相一致,例如最近 ScienceDirect 的一项调查强调了生成模型在增强稀疏用户与商品信号方面的能力。

扩展工具

NVIDIA 的 recsys-examples 仓库为在 GPU 上训练和部署生成推荐系统提供了模块化解决方案。关键组件包括:

  • DynamicEmb: 一个 GPU 优化的哈希表,可为高基数数据动态分配嵌入,解决了 GPU 内存限制问题。
  • HSTU(分层序列变换单元): 一种基础的生成推荐模型,通过学习的序列表示取代传统的特征工程,大幅提升效率。
  • nv-embedding-cache: 一个用于在 GPU 和 CPU 内存层之间管理大嵌入表的 SDK,优化了生产规模推荐系统的推理延迟。

例如,使用 NVIDIA 的 Hopper 和 Blackwell GPU 运行 HSTU 模型,训练效率从 7.65% 提高到 31.4% 的模型浮点运算利用率(MFU),展示了其在成本效益扩展方面的潜力。同样,基于语义 ID 的生成推荐框架在离线推荐延迟方面比传统方法快了 2.27 倍,突显了 NVIDIA 在满足严格服务级别协议(SLA)方面的关注。

市场影响

将 LLMs 引入推荐工作流反映了 AI 理解用户意图、丰富稀疏数据和提升个性化的更广泛转变。今年早些时候,Meta 推出了 SilverTorch,这是一个针对大规模推荐的索引即模型检索范式,进一步推动了生成技术的竞争发展。

NVIDIA 的进步也与 2026 年在圣何塞举办的 GTC 大会上强调的趋势相符,其中生成推荐系统被定位为广告、搜索和排序管道的重要工具。尽管基于 LLM 的推荐系统在部署成本和延迟方面仍面临挑战,但 NVIDIA 的 GPU 优化解决方案旨在缩小这些差距,使生成推荐系统更具商业可行性。

随着领域的不断发展,结合 LLMs、图神经网络和检索技术的混合模型可能会占据主导地位。对于企业来说,这意味着更准确的客户预测、更高的转换率和在不牺牲性能的情况下扩展个性化的能力。

展望未来

NVIDIA 对生成推荐系统的关注标志着推荐行业的一个重要时刻,越来越多的公司采用 LLMs 实现大规模个性化。通过像 recsys-examplesnv-embedding-cache 这样的工具,NVIDIA 将自己定位为下一代 AI 驱动数字体验的引领者。

对于开发人员来说,这些资源现在已在 GitHub 上提供,包含详细的基准测试和快速入门指南,以加速采用。随着 LLMs 继续重塑 AI 领域,NVIDIA 的生成方法可能会定义推荐系统的未来。


Read More