Copied


阿里巴巴发布具有1760亿参数的Qwen3.8-Flash-Next AI模型

realtime news   Aug 26, 2026 17:50 1 Min Read


阿里巴巴发布了其Qwen3.8-Flash-Next多模态模型的权重,这是一个具有1760亿参数的专家混合(MoE)架构,专为处理长上下文任务设计,例如代理编码、文档处理和高负载工作流。该发布于8月26日宣布,作为即将推出的Qwen4模型系列的技术预览,重点是为开发者提供成本效益和可扩展性。

技术亮点

Qwen3.8-Flash-Next结合了两项关键创新以实现长上下文推理:Gated DeltaNet (GDN) 和 Qwen Sparse Attention (QSA)。GDN将历史上下文压缩为一个固定大小的循环状态,避免了长序列通常伴随的内存增长。同时,QSA在微块级别工作,以减少计算开销,同时保持检索精度。这些机制共同实现了对多达100万标记序列的高效处理,这是传统注意力模型难以应对的领域。

阿里巴巴分享的基准测试表明,QSA带来了显著的性能提升。例如,在一个具有90%前缀缓存命中率的100万标记工作负载中,Qwen3.8的预填充吞吐量是其前代Qwen3.7-Plus的8.6倍。在预填充和解码阶段,稀疏注意力内核的性能分别比全注意力高出7.6倍和4.9倍,突显了其在高负载应用中的实用性。

优化针对NVIDIA GB300 NVL72

NVIDIA与阿里巴巴合作验证了Qwen3.8-Flash-Next在其GB300 NVL72平台上的表现,该平台集成了72个Blackwell Ultra GPU,并配备了130 TB/s的NVLink通信结构。该模型每个GPU每秒可处理超过16,000个标记,每用户每秒支持超过200个标记,非常适合在生产环境中的大规模部署。开发者还可以在较小的系统上实验该模型,例如NVIDIA DGX Spark集群或配备RTX PRO 6000 Blackwell GPU的工作站。

开发者工具和可访问性

Qwen3.8-Flash-Next以开放权重的形式提供,开发者可以从例如Hugging Face和ModelScope等平台下载。NVIDIA通过其NeMo AutoModel库支持微调,使得可以通过LoRA等高效方法进行领域特定的适配。NeMo RL配方也支持强化学习工作流。

在推理方面,开发者可以选择多种工具,包括SGLang、vLLM和NVIDIA TensorRT,确保部署的灵活性。阿里巴巴将此次发布定位为一种具有成本效益的模型,让开发者在Qwen4发布之前原型化并扩展工作流。

为什么这很重要

Qwen3.8-Flash-Next代表了大型语言模型进化的一个重要里程碑。通过解决长上下文任务的可扩展性挑战,阿里巴巴正在为多模态AI解决方案的更广泛采用奠定基础。尽管此次发布主要是技术预览,但其在稀疏注意力和内存效率方面的创新可能会影响下一代AI架构和工具。


Read More