Copied


NVIDIA 提升生物模型的 MoE 训练效率

realtime news   Sep 24, 2026 16:08 1 Min Read


NVIDIA 公布了在使用专家混合(MoE)架构训练生物基础模型方面的新进展。BioNeMo MoE 配方由 NVIDIA 的 Transformer Engine (TE) 提供支持,与传统稠密 Transformer 实现相比,训练吞吐量提高了高达 2.21 倍,为 AI 驱动的生物研究在可扩展性和效率方面迈出了重要的一步。

MoE 架构在 AI 尤其是大型语言模型(LLMs)和领域特定应用中日益受到关注。与稠密 Transformer 模型中每个 token 需要经过每一层不同,MoE 仅为每个 token 激活一部分专家子网络。这种方法大幅减少了计算需求,在不成比例增加资源需求的情况下实现了更高的模型容量。这种效率对具有较长序列长度和大参数数量的生物数据集尤为重要。

BioNeMo 的优化训练

NVIDIA 的 BioNeMo MoE 配方利用 TE 解决了 MoE 实施中的关键挑战。传统的 MoE 训练可能面临计算分散、内存瓶颈和量化开销等问题,这些问题会阻碍 GPU 的利用率和可扩展性。TE 引入了多种优化,包括:

  • GroupedLinear 操作: 该技术将专家计算批处理为更少的 GPU 调用,从而减少开销并提高并行性。
  • MXFP8 精度: 通过使用混合精度格式,该配方将内存使用量减少了一半(与标准 BF16 相比),同时通过块级缩放保持数值稳定性。
  • 融合内核: 将多个操作合并为单个 GPU 内核最小化框架开销并加速计算。

这些优化对基因组学和生物学工作负载特别有用,这类训练涉及长 DNA 或蛋白质序列。通过优化 GPU 的效率,研究人员可以在八个 NVIDIA B200 Tensor Core GPU 上扩展类似 Mixtral-8x7B 的模型,同时保持精度和性能。

MoE:现代 AI 的关键架构

专家混合已成为高效扩展大型模型的关键架构。包括 NVIDIA 和 IBM 在内的行业巨头已强调 MoE 能够通过稀疏激活参数来处理更大的模型容量。这对生成式 AI 和领域特定模型尤其重要,因为计算效率至关重要。

然而,MoE 也带来了技术挑战,例如在专家之间平衡工作负载和高效管理内存。NVIDIA 的 Transformer Engine 直接解决了这些瓶颈,使公司在 MoE 优化方面处于领先地位。BioNeMo 的进步可能会转化为生物学以外的更广泛应用,包括自然语言处理、药物发现和精准医学。

实际意义

NVIDIA 的方法突显了 MoE 架构在 AI 计算扩展中的变革潜力。通过 BioNeMo 配方,研究人员现在可以更快、更具成本效益地训练更大的模型,使以前无法实现的项目成为可能。对于利用 AI 进行生物研究的机构和企业,高效扩展的能力可能会加速基因组学和分子生物学领域的突破。

BioNeMo 配方提供了详尽的文档和基准配置。研究人员可以从两个 GPU 的设置开始验证,并扩展到八个 GPU 进行全面训练。截至 2026 年 9 月,该配方专为 NVIDIA Blackwell GPU 量身定制,充分利用了 MXFP8 硬件加速。

未来展望

随着 MoE 的广泛采用,NVIDIA 的 BioNeMo 为专业 AI 领域的高效训练设定了新标准。凭借其显著的吞吐量提升和可扩展性,该配方可能会激发稀疏建模技术的进一步创新。对于开发者和研究人员来说,这标志着 AI 架构演变的一个关键时刻,尤其是在需要高计算效率的领域。

欲了解更多详情,NVIDIA 的官方博客提供了有关实现 BioNeMo MoE 配方的深入指南和示例配置。


Read More