Copied


SkyRL 采用 FP8 用于强化学习,将部署时间缩短 23%

realtime news   Aug 25, 2026 18:28 1 Min Read


SkyRL 是一个强化学习(RL)框架,现已在其训练和部署过程中引入了 FP8 精度,从而在降低硬件负载的同时实现了更快的模型收敛。据 2026 年 8 月 25 日的一篇博文,FP8 将 NVIDIA Hopper(H100)和 Blackwell(B200)GPU 上的 RL 步骤时间减少了最多 23%,并保持与 BF16 相当的性能。这一进步标志着 RL 工作负载向精度优化方向的转变,特别是在大型语言模型(LLMs)和人类反馈强化学习(RLHF)领域。

这一创新依赖于 SkyRL 的在线策略权重同步(OPWS),确保部署引擎使用精确的 FP8 训练策略,从而避免了以往独立 FP8 配置中存在的数值不匹配问题。这一改进解决了其他 FP8 RL 技术堆栈中存在的挑战,例如 NVIDIA 的 NeMo RL 和近期学术提案 Jet-RL,它们警告称训练和部署阶段量化不匹配可能导致的不稳定性。

FP8 在 RL 效率中的作用

FP8,即 8 位浮点精度,相较于 BF16 和 FP32 在 RL 工作负载中具有显著优势。它减少了内存传输,降低了 GPU 内存需求,并提高了张量核的算术吞吐量。对于主导 RL 步骤时间的工作负载(如部署生成),FP8 可直接转化为更快的解码和更高的效率。SkyRL 报告称,FP8 参数存储减少了每块 GPU 的内存使用量 39%-42%,释放了资源以支持更大的模型或更长上下文的部署。

这些优化对 LLM 强化学习尤其重要,因为内存瓶颈通常限制了性能。例如,SkyRL 的 FP8 技术堆栈在测试 Qwen3.5 模型系列(包括密集的 9B 和专家混合(MoE)的 35B-A3B 配置)时,在长部署情境下实现了 19%-23% 的步骤时间减少。

解决稳定性问题:为什么 OPWS 很重要

FP8 强化学习的主要风险之一是训练引擎和部署引擎之间量化不一致导致的不稳定性。SkyRL 的 OPWS 通过直接将训练器生成的 FP8 权重和块级比例元数据传递到部署引擎,避免了中间的去量化和再量化步骤,从而消除了这一问题。这确保了数值一致性,对于在线策略 RL 来说至关重要,因为采样的轨迹必须与正在优化的策略一致。

在使用 8 个 H100 GPU 测试 Qwen3.5-9B 模型时,SkyRL 展示了 OPWS 将训练-部署对数概率差距稳定保持在 0.02 至 0.03 之间,跨越 400 步骤仍在 RL 工作负载可接受范围内。相比之下,使用独立量化的旧方法在类似条件下表现出偏差,对数概率差距超过了 0.05。

对行业的影响

SkyRL 采用 FP8 精度强调了低精度 AI 工作负载的行业趋势。NVIDIA 一直是这一领域的推动力量,其 2026 年 4 月的一篇博文强调了 FP8 在加速 RL 的同时保持准确性的能力。学术研究(如 2026 年 1 月发表的 FP8-RL 论文)也探讨了 FP8 在 veRL 和 Megatron-LM 等 RL 技术堆栈中的实际应用。

虽然 FP8 强化学习并非一个独立的市场,但其商业意义直接与 AI 硬件和软件生态系统相关联。NVIDIA 的 Hopper 和 Blackwell GPU 以及像 NeMo RL 和 SkyRL 这样的框架是大规模部署 FP8 的领先平台。通过降低 RL 微调的成本和复杂性,FP8 有可能使高级 LLM 优化对更小的参与者也可用,从而进一步推动 AI 开发的民主化。

未来展望

SkyRL 的 FP8 技术堆栈已经在效率和可扩展性方面证明了其价值,但仍然存在一些挑战。FP8 尚未涵盖所有操作——注意力机制和优化器状态仍然依赖于更高的精度。此外,硬件特定的限制(如 Blackwell 依赖于粗粒度量化)可能会限制某些配置中的采用。

尽管如此,SkyRL 在 FP8 方面的成功证明了其在重塑强化学习工作流程中的潜力。随着研究人员和行业领导者的兴趣日益增长,FP8 有望成为下一代 AI 加速器上 RL 优化的基石。


Read More