模型千问Qwen官方动态·原文 2026年8月26日本站收录 2026年9月5日

阿里发布Qwen3.8-Flash-Next开源权重:125B参数MoE模型,训练成本约为Qwen3.7-Plus的1/9

Qwen团队发布Qwen3.8-Flash-Next开源权重,作为Qwen4架构的先导预览。模型总参数量125B,每token激活6B,原生支持262,144 token上下文,在千问AI平台以Qwen3.8-Flash名称提供API服务,输入每百万Tokens 0.8元。

AI解读:Qwen团队此次提前发布Qwen3.8-Flash-Next的开源权重,目的是让社区在Qwen4完整模型家族构建前检验其结构改动。模型在注意力、残差、嵌入和优化四个方向做了升级,引入了QSA稀疏注意力、Gated Residual、N-gram Embedding等新机制,其中N-gram Embedding以51B参数拓展容量但几乎不增加每token计算量。相比Qwen3.7-Plus,训练开销约为其1/9,但官方称在编码和办公任务上能力更强——注意这是Qwen团队自己的基准测试结果,例如在DeepSWE 1.1上得分58.7对比16.5、CoWorkBench上73.9对比65.1。对开发者而言,模型以开放权重和API两种形式提供:开源权重可在Hugging Face和ModelScope下载,生产版本在千问AI平台以qwen3.8-flash名称提供服务,支持262K原生上下文并可扩展到1M token。这一变化意味着高并发应用或工具驱动型工作流可能降低推理成本,但实际效果仍需独立复现。普通用户无需立即行动,因为这是模型发布公告,实际性价比需要看第三方评测和真实场景表现。

Qwen团队于2026年8月发布Qwen3.8-Flash-Next的开源权重,这是一个多模态MoE模型,官方称其作为Qwen4所用模型结构的先导预览,与Qwen3-Next对Qwen3.5系列的角色一致。主模型参数量125B,额外配备51B N-gram Embedding,每token激活6B参数。相比Qwen3.7-Plus,官方称训练开销约为其1/9,但在编码和办公任务上能力更强。模型原生支持262,144 token上下文,并可通过YaRN扩展至1,000,000 token。权重已在Hugging Face与ModelScope发布;千问AI平台以Qwen3.8-Flash名称提供服务,默认1M上下文并内置官方工具,定价为每百万Tokens输入0.8元、输出2.7元。

架构改动与创新点

  • Attention:采用GDN + QSA Hybrid架构。Gated DeltaNet(GDN)在每四层中占三层,将历史信息压缩到固定大小状态;另一层保留全局Attention,并引入Qwen Sparse Attention(QSA),通过压缩式轻量Indexer在micro-block粒度筛选重要上下文。官方称在1M token上,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6×和4.9×加速。
  • Residual:引入Gated Residual(GR),将Residual Stream扩展为4条并行分支,通过动态Gate控制信息读写。分析显示其中一条branch会自然形成连接第一层Attention和大部分中后层的长距离通道。Residual State支持FP8存储。
  • Embedding:引入N-gram Embedding,结合当前token与前几个token的局部上下文查表,额外提供51B参数。这些参数可存放在Host Memory,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存。
  • Optimization:采用Muon Optimizer,针对正交化精度、Muon与AdamW的参数分工、融合参数拆分进行优化。Attention、GDN、MoE Expert主要权重使用Muon;Embedding、MoE Router、GR低秩参数使用AdamW。重新拟合了Scaling Law,可稳定使用更大Learning Rate和Batch Size。
  • 其他:固定激活专家数量而持续增加专家池参数量;MTP模块以多步方式训练;保留Zero-Centered RMSNorm、注意力输出门控、MoE router初始化归一化。

文本与多模态基准成绩

官方在技术报告中列出了基准测试结果,其中最佳分数的项用粗体标出。所有结果均为Qwen团队自行测试,评测框架与模型版本不同可能影响可比性。

  • 纯文本:在DeepSWE 1.1上得分58.7(对比Qwen3.8-27B 42.2、Qwen3.7-Plus 16.5、DeepSeek-V4-Flash-0731 54.4、Claude-Opus-4.6 Max--);SWE-bench Pro上62.5(对比27B 61.7、3.7-Plus 55.8);CoWorkBench上73.9(对比3.7-Plus 65.1);JobBench上55.7(对比3.7-Plus 27.6);Agents' Last Exam Pass@1 24.3(对比3.7-Plus 13.2);Toolathlon Verified Pass@1 73.5(对比3.7-Plus 50.6);IFBench 81.3;GPQA Diamond 91.7;HLE 35.9;LiveCodeBench v6 91.9。注:DeepSWE用Claude Code和mini-SWE-agent评测,报告最高分,Qwen3.8-Flash-Next在mini-SWE-agent上最佳。
  • 多模态:ClawEval-MM Pass@3 64.4(对比3.8-27B 57.4、3.7-Plus 57.4、Claude-Opus-4.6 52.5);RecreationBench 49.9(对比3.7-Plus 30.2);AndroidWorld 84.5(对比3.7-Plus 81.0);OSWorld 2.0 Binary 19.4 Partial 52.3;Vision2Web 64.0(对比3.7-Plus 42.1)。注:ClawEval-MM分数格式为pass@3/平均分;OSWorld 2.0分数格式为binary/partial。
  • Base模型:在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优成绩,包括MMLU-Pro 73.23、SuperGPQA 51.36、BBH 90.87、GSM8K 93.29、EvalPlus 78.76、SWEBench-Pretrain 50.99、MGSM 89.33、MMMLU 84.86。MMLU 90.36、MMLU-Redux 90.68、GPQA 51.42、MATH 72.78与MultiPL-E 79.09与Qwen3.7-Plus-Base接近(后者MMLU 90.43略有优势)。注:51B N-gram embedding是确定性寻址,不进入每token矩阵乘预算。

API与工具集成信息

  • 千问AI平台:模型以qwen3.8-flash名称提供,支持OpenAI兼容的Chat Completions和Responses API,以及Anthropic兼容接口。支持推理等级xhigh、medium、low,可启用thinking模式。
  • 集成工具:千问办公已接入Qwen3.8-Flash-Next驱动其“标准”模式;Claude Code可通过配置ANTHROPIC_MODEL环境变量使用;Codex通过model-catalog.json和config.toml配置;Qwen Code和OpenClaw也已支持。

信息来源