Copied


Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上亮相,推动长上下文 AI 应用

realtime news   Aug 27, 2026 02:10 1 Min Read


阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,这是一个实验性的多模态专家混合(MoE)AI 模型,旨在突破长上下文处理的边界。作为即将推出的 Qwen4 架构的预览,该模型拥有面向高效能、高上下文应用的尖端创新。开发者现在可以在 NVIDIA 强大的 GB300 NVL72 平台上运行 Qwen3.8-Flash-Next,在代理编码、文档处理等领域实现前所未有的吞吐量和扩展性。

Qwen3.8-Flash-Next 模型拥有 1250 亿参数的基础模型,并增加了 510 亿 N-gram 嵌入,以及原生 262,144-token 的上下文窗口,通过 YaRN 框架可扩展到 100 万 token。这使其特别适合需要大量顺序数据处理的任务,例如法律文档分析或基于工具的自动化工作流程。

技术创新:GDN 和 QSA

Qwen3.8-Flash-Next 的核心是两项架构突破:Gated DeltaNet (GDN)Qwen Sparse Attention (QSA)。GDN 通过将历史上下文压缩到固定大小的递归状态中,消除了增长的键值(KV)缓存的内存负担。这确保了无论序列长度如何,性能都保持一致。同时,QSA 通过将序列聚合为微块并仅检索最相关的区域,解决了长上下文注意力中的计算效率问题,从而显著降低了开销。

阿里巴巴发布的基准测试验证了这些创新。在 100 万 token 的上下文长度下,据报道 QSA 注意力内核在预填充方面提供了 7.6 倍的加速,在解码方面提供了 4.9 倍的加速,相比于传统的全注意力机制。在真实服务测试中,具有 90% 前缀缓存命中率的情况下,Qwen3.8-Flash-Next 在预填充吞吐量上比前代 Qwen3.7-Plus 提高了 8.6 倍

在 NVIDIA GB300 NVL72 上的性能

NVIDIA GB300 NVL72 平台配备 72 个 Blackwell Ultra GPUs 和 130 TB/s 的 NVLink 通信域,是 Qwen3.8-Flash-Next 部署的核心支持。这一配置使得模型能够每个 GPU 每秒处理超过 16,000 个 token,相当于每个用户每秒处理超过 200 个 token。这样的性能突显了其在高吞吐量、低延迟应用中的潜力。

对于开发者来说,Qwen3.8-Flash-Next 的可扩展性令人瞩目。虽然大规模部署可以利用 GB300 NVL72,小规模设置可以使用 NVIDIA DGX Station 或配备 RTX PRO 6000 GPUs 的工作站进行原型开发。

微调与部署

希望为特定用例定制模型的开发者可以利用 NVIDIA NeMo 工具。NeMo AutoModel 库支持直接在提供的检查点上进行微调,无论是全监督微调(SFT)还是内存高效的低秩适配(LoRA)。对于强化学习,NVIDIA 的 NeMo RL 配方 提供额外的优化路径。

推理选项灵活,支持的技术栈包括 SGLangvLLMTokenSpeed。在 Hugging FaceModelScope 上提供的开源权重确保了实验的可访问性。

展望未来

Qwen3.8-Flash-Next 是迈向 Qwen4 模型家族的一块基石,阿里巴巴将其用作下一代架构概念的测试平台。在注意力机制和内存效率方面的创新表明,其在长上下文 AI 应用中的潜在变革性。开发者现在可以利用这一尖端模型进行实验,并为 Qwen4 的发布做好准备。


Read More