阿里发布Qwen3.8-Flash-Next预览模型,NVIDIA GB300 NVL72上单GPU吞吐超 1.6 万token/秒

Qwen3.8-Flash-Next采用混合架构,125B参数MoE模型仅激活 6B,原生上下文 26 万token,可扩展至 100 万;NVIDIA提供Day 0支持并给出性能数据。

AI解读:Qwen3.8-Flash-Next是阿里为展示下一代Qwen4架构而提前放出的模型权重,核心是解决长上下文场景下推理速度慢、显存占用高的问题。它采用了混合架构:每四层中有三层是Gated DeltaNet(把历史信息压缩成固定大小状态,避免上下文越长KV缓存越涨),剩下一层是Qwen稀疏注意力(把序列切成块,只挑重要的块计算),从而在长文本下减少计算量。NVIDIA在GB300 NVL72上测得的数字是单GPU每秒超 1.6 万token、单用户每秒超 200 token,相比全注意力机制,1M上下文时预填充最高提速 7.6 倍,解码提速 4.9 倍。对开发者来说,这意味着可以在本地(DGX Station、DGX Spark或 4×RTX PRO 6000工作站)先原型验证,再无缝迁移到GB300 NVL72做生产,并且能直接用NeMo工具微调或用SGLang、vLLM等引擎跑。但要注意,这只是预览版,不是正式模型,基准测试主要来自阿里公布的数据,NVIDIA的支持是尽力而为,实际效果需要自己跑分验证。如果你做代码代理、长文档处理这类高吞吐应用,值得拿权重试试;如果只是普通聊天,没必要追新。未来影响可能在于:如果Qwen4延续这种GDN+QSA架构,长上下文推理的成本和延迟可能明显下降,但这还取决于其他厂商是否跟进。

阿里发布了Qwen3.8-Flash-Next的模型权重,作为即将推出的Qwen4架构的预览版,供开发者实验和评估。该模型为多模态专家混合(MoE)架构,主模型有 125B参数,还额外附加 51B的N-gram嵌入,每个token激活 6B参数。

模型原生支持 262,144 token的上下文窗口,可通过YaRN扩展到 100 万token。NVIDIA提供尽力的Day 0功能支持,覆盖SGLang、vLLM和NVIDIA TensorRT LLM,并在NVIDIA GB300 NVL72上完成推理验证,还提供来自NVIDIA NeMo AutoModel和NVIDIA NeMo RL的后训练方案。

在NVIDIA GB300 NVL72上运行时,Qwen3.8-Flash-Next可实现每GPU每秒超过 16K token、每用户每秒超过 200 token的吞吐,使开发者能够以高吞吐和低延迟进行代理编码应用实验。

混合架构:GDN与QSA结合,解决长上下文瓶颈

Qwen3.8-Flash-Next面向大流量、上下文密集型应用(如代理编码、文档处理和工具驱动的工作流)。随着上下文增长,注意力计算和KV缓存内存会成为瓶颈。该模型通过结合Gated DeltaNet(GDN)与Qwen稀疏注意力(QSA)的混合架构来解决这两个问题。

每四层中有三层使用GDN,将历史上下文持续压缩成固定大小的循环状态,从而在序列变长时消除KV缓存的增长。剩余的一层使用QSA,在整个上下文中进行精确检索。

之前的稀疏注意力方法依赖token级索引器,随着上下文长度增长,其计算成本会越来越高。QSA将序列聚合成微块,在块级别评估其重要性,并且只选择最相关的区域。这减少了每层内的注意力、计算和索引开销,使该设计非常适合GDN与QSA层交替的架构。

基准测试与性能数据

阿里巴巴公布的基准测试表明,QSA可提高 100 万token工作负载的效率。与全注意力机制相比,其注意力内核在预填充阶段实现了最高 7.6 倍的加速,在解码阶段实现了 4.9 倍的加速。

在 100 万token上下文长度、90% 前缀缓存命中率的缓存密集型在线服务测试中,Qwen3.8-Flash-Next的预填充吞吐量是Qwen3.7-Plus的 8.6 倍。

运行与本地部署选项

GB300 NVL72采用机架级架构,将 72 块NVIDIA Blackwell Ultra GPU集成于单个平台。其大型 72-GPU NVIDIA NVLink域支持 130 TB/s的全对全通信,消除了专家流量穿越传统商用网络时出现的瓶颈。

除了机架级部署外,Qwen3.8-Flash-Next也能在本地NVIDIA硬件上运行,包括NVIDIA DGX Station、NVIDIA DGX Spark集群,以及配备四块NVIDIA RTX PRO 6000 Blackwell Max-Q工作站版GPU的工作站。开发者可以在本地硬件上对代理编码工作流进行原型设计和评估,并将同一模型扩展到GB300 NVL72进行生产服务。

  • 开发者可使用NVIDIA NeMo AutoModel(一个PyTorch原生微调库,支持Hugging Face检查点Day-0支持)对模型进行微调。可直接在现有检查点上训练,无需模型转换,支持全量SFT或节省内存的LoRA微调。
  • 用户可以通过NVIDIA NeMo RL方案进行强化学习。NVIDIA支持多个推理栈,SGLang、vLLM和TokenSpeed提供开源推理方案,供开发者在NVIDIA加速平台上按需控制性能。
  • 开发者可从QwenCloud试用模型,从Hugging Face或ModelScope下载模型权重。
查看原图 · 1920 × 1080
查看原图 · 1536 × 864
查看原图 · 1024 × 576
查看原图 · 960 × 540
查看原图 · 1166 × 1416
查看原图 · 4000 × 2300

信息来源