NVIDIA FLARE 扩展了 Kubernetes 和 Slurm 的联邦学习功能
NVIDIA 推出了其联邦学习平台 FLARE 的升级版本,引入了对 Slurm 调度的支持,并扩展了在 Docker 和 Kubernetes 环境中的兼容性。这一进步使组织能够在异构基础架构上扩展联邦学习(FL)项目,而无需对参与站点进行标准化。FLARE 2.9 于 2026 年 9 月发布,旨在解决联邦学习中多组织合作所面临的一个持久性障碍:操作复杂性。
联邦学习是一种去中心化的机器学习方法,敏感数据保持本地,同时通过协作训练模型。自 2016 年由谷歌首次提出以来,联邦学习现已广泛应用于对隐私要求敏感的行业,如医疗和金融。NVIDIA FLARE 是该生态系统中的关键工具,可实现联邦学习工作流程的安全、可扩展执行。
解决基础架构碎片化问题
在许多联邦学习用例中,参与的组织运行着多种多样的基础架构——有些可能依赖于 Docker 托管的环境,有些使用 Kubernetes 集群,而高性能计算(HPC)中心通常使用 Slurm 进行 GPU 调度。此前,这些差异常常需要基础架构标准化,从而增加了协作的摩擦。NVIDIA FLARE 通过采用两层架构绕过了这一难题:用于协调的持久联邦服务层和面向每个参与者本地环境的动态任务执行层。
使用 FLARE 2.9,联邦学习可以无缝集成 Slurm 管理的集群,这对于利用 HPC 系统的研究机构和企业来说是一个重要的补充。Slurm 加入了 Docker 和 Kubernetes 成为支持的运行时之一,在保留对计算策略、数据集和安全设置的本地控制的同时解锁了灵活性。
FLARE 架构的工作原理
FLARE 将长期运行的联邦服务与任务执行分开。持久的父进程维护联邦,而任务工作器则根据需要动态启动以执行特定任务。例如,当数据科学家提交一个联邦学习任务时,系统会根据特定研究的配置分配所需的资源——GPU、CPU 和内存。每个站点的启动器会将这些要求转化为本地执行单元:Docker 容器、Kubernetes pod 或 Slurm 批处理任务。
这种设计确保了资源仅在任务实际运行时被消耗,从而将开销降到最低。它还允许组织维护现有的操作策略,例如 Kubernetes 中的节点分配或 Slurm 中的服务质量规则。
市场与应用影响
FLARE 2.9 的发布恰逢联邦学习市场的快速增长。据 Grand View Research 数据显示,该行业预计到 2030 年将达到 2.975 亿美元,与 2026 年估计的 1.671 亿美元相比,年复合增长率(CAGR)为 14.4%。这种增长由隐私保护型 AI 解决方案在医疗等领域的需求驱动,在这些领域中,组织必须遵守严格的数据共享法规,同时利用 AI 分析敏感数据集。
通过解决基础架构异质性问题,FLARE 使那些此前在部署复杂性方面遇到困难的组织能够更容易地采用联邦学习。用例包括医院在医学影像分析方面的合作、银行整合欺诈检测模型,或工业参与者优化物联网系统。每个参与者在贡献于共享模型的同时,仍然保持对其本地资源的控制。
下一步是什么?
随着运行时支持的扩展,NVIDIA FLARE 已经做好了充分准备来利用联邦学习的增长势头。对部署 FLARE 感兴趣的组织可以查阅其文档或 GitHub 仓库获取实施指南。随着联邦学习市场的演变,互操作性和操作灵活性将继续是关键,NVIDIA 的方法可能成为在生产级别扩展去中心化 AI 的蓝图。